视频检索新SOTA
通过轨迹到词的注意力对齐视频中的物体轨迹与文本,解决视频-语言任务。
Yang, Xu · Zhangzikang, Li · Xu, Haiyang · Zhang, Hanwang · Ye, Qinghao · 李晨亮 · Yan, Ming · 张宇 · Huang, Fei · Huang, Songfang
2023
T2W注意力对轨迹内所有patch进行建模,避免P2W只关注孤立空间区域而忽略物体运动轨迹。
HFS只在微调阶段插入,逐步选择适合帧,避免增加预训练负担,同时保留关键时间上下文。