自适应时空问答模型

三数据集刷新SOTA

一个模型同时解决跨模态时空推理与细粒度对齐,无需为每个数据集单独调参。

Mingxiang, Wen · Yixin, Wang · Xujian, Zhao · 金培权 · 陈鸿友 · Li, Bo · Long, Yin · 任珍文 · Li, Xingfeng · 杨春明 · 张晖

Pattern Recognition 2026

参数信息

问答准确率
77.04 %
问答准确率
72.27 %
问答准确率
91.3 %

技术优势

一个模型通吃三个数据集

无需为每个数据集单独调参,即可在 MUSIC-AVQA、MUSIC-AVQA-R、AVQA 上取得最高准确率。

能自适应定位关键视听片段

上下文时空推理组件根据问题动态定位相关视听片段和视觉实体,提升推理效率。

细粒度对齐让语义更准

细粒度信息推理模块编码多粒度语义细节并与查询驱动的视听动态融合,提升跨模态理解精度。

应用场景