动态适应多任务
该模型动态调整视觉与文本间的关系表示,在多模态教材理解任务中优于现有基线。
宋凌云 · Wenqing, Du · 韩晓林 · 甘新标 · Wang, Xiaoqi · 尚学群
Information Fusion 2025
模型利用不同任务中的上下文信号动态调整视觉与文本间的关系表示,而非使用固定图结构。
在三个多模态教材数据集上,模型在生成准确分类和答案方面优于最先进的基线方法。