组合推理增强策略

对齐GPT-4V

针对多模态大语言模型组合推理缺陷,增强细粒度视觉信息的同时保持通用理解能力。

Shun, Qian · 刘秉权 · 孙承杰 · Xu, Zhen · Wang, Baoxun

Lecture Notes in Computer Science 2026

技术优势

对齐GPT-4V

采用多层视觉特征和对比学习阶段,LLaVA-1.5-7B在特定组合推理任务上达到GPT-4V水平。

通用性能不降

该策略不仅保持而且提升了模型在通用多模态基准上的表现,避免了专门化带来的遗忘。

应用场景