提前且更准
一种利用CLIP预训练视觉和文本编码器、仅微调适配器即可实现交通事故预警的多模态架构。
77351769 · Chen, Yietarng · Fang, Wen Hsien
IEEE Transactions on Circuits and Systems for Video Technology 2025
通过时空与文本适配器联合建模长距离时空交互,显著改善预警及时性与正确性。
仅微调适配器即可利用CLIP预训练知识,降低重新训练需求。
文本编码器将语义信息与视觉特征对齐,提升对复杂交通场景的表示能力。