以合作博弈建模视频-文本细粒度对齐,通过分层Banzhaf交互实现可解释、高效的跨模态表征学习。
金澎 · Huang, Jinfa · Xiong, Pengfei · Tian, Shuangxuan · Liu, Chang · 季向阳 · Yuan, Li · 陈杰
2023
通过将视频帧与文本词视为博弈参与者,用分层Banzhaf交互衡量它们之间可能的对应关系,实现敏感且可解释的跨模态对比。
该方法可作为可视化工具,帮助理解视频帧与文本词之间的细粒度对应关系,促进对跨模态交互机制的理解。