多图推理更准
交替预训练策略让模型在跨模态理解中保持文本能力且提升多图推理,训练方案可直接复现。
Lin, Ji · Yin, Hongxu · Ping, Wei · Molchanov, Pavlo A. · Shoeybi, Mohammad · Han, Song
2024
指令微调阶段重新混合纯文本指令数据,不仅修复文本任务退化,还提升视觉语言任务准确率。
多模态预训练赋予模型多图像推理能力,使其能够联合分析多张图像。
模型可部署于 Jetson Orin,支持端侧视觉语言模型应用。