长视频理解免微调
将长视频解析为多粒度层次化文本表示,去除视觉与文本冗余,使单一方法免微调适配多种视频理解任务。
Zeng, You · Wen, Zhiquan · Chen, Yaofo · Li, Xin · 曾润浩 · Wang, Yaowei · 谭明奎
IEEE Transactions on Circuits and Systems for Video Technology 2024
生成的多粒度文本表示可直接用于多种下游任务,无需针对每个任务重新训练模型。
在视觉和文本两个层面去除冗余信息,避免无关内容对长视频理解的干扰。