视觉语言零干扰
文本和图像在同一个特征空间里生成与理解,视觉生成和语言理解任务随模型增大而相互促进,不再互相干扰。
武俊峰 · 蒋毅 · Chuofan, Ma · Liu, Yuliang · Zhao, Hengshuang · Yuan, Zehuan · 柏松 · 白翔
International Journal of Computer Vision 2026
直接利用任何现成的大语言模型作为基础,无需 CLIP 或扩散模型,简化了架构和训练流程。
以现成 LLM 为底座,显著降低预训练开销,同时多模态能力超越 Chameleon。
统一的 token 空间使生成和理解任务相互促进,消除了早期模型中常见的干扰。