三数据集刷新SOTA
一个模型同时解决跨模态时空推理与细粒度对齐,无需为每个数据集单独调参。
Mingxiang, Wen · Yixin, Wang · Xujian, Zhao · 金培权 · 陈鸿友 · Li, Bo · Long, Yin · 任珍文 · Li, Xingfeng · 杨春明 · 张晖
Pattern Recognition 2026
无需为每个数据集单独调参,即可在 MUSIC-AVQA、MUSIC-AVQA-R、AVQA 上取得最高准确率。
上下文时空推理组件根据问题动态定位相关视听片段和视觉实体,提升推理效率。
细粒度信息推理模块编码多粒度语义细节并与查询驱动的视听动态融合,提升跨模态理解精度。