多模态匹配更精
将文本特征解耦为短语级与词级表示,分别与对象和事件原型对齐,实现细粒度时空语义匹配。
Li, Pandeng · Chen-Wei, Xie · Zhao, Liming · 谢洪涛 · Jiannan, Ge · Zheng, Yun · Zhao, Deli · 张勇东
2023
通过预测关键图像块或词生成对象与短语原型,优化局部对齐,使模型感知视频中的空间细节。
设计的时序原型生成机制关联帧内对象并交互帧间关系,逐步生成的事件原型能揭示视频中的语义多样性,实现动态匹配。
在四个视频检索基准上一致超越现有最优方法,验证了框架的有效性。