MoCA多模态理解模型

教科书问答新高度

提出域预训练与交叉引导多模态注意力,解决复杂文本与图表融合问题,在教科书问答任务中取得领先性能。

Xu, Fangzhi · Lin, Qika · Liu, Jun · 张玲玲 · Zhao, Tianzhe · Chai, Qi · Pan, Yudai · Huang, Yi · 王茜莺

Pattern Recognition 2023

技术优势

术语理解更准

通过多阶段域预训练和术语语料库启发式生成算法,增强语言模型对领域特定术语的表示能力。

多图协调利用

跨引导多模态注意力机制基于渐进式策略更新文本、问题图和教学图的特征表示,充分利用不同类型图表的互补信息。

集成效果更稳

双门控机制改进三个背景检索结果的模型集成,确保多种信息源的有效融合。

应用场景