原生统一多模态模型

视觉语言零干扰

文本和图像在同一个特征空间里生成与理解,视觉生成和语言理解任务随模型增大而相互促进,不再互相干扰。

武俊峰 · 蒋毅 · Chuofan, Ma · Liu, Yuliang · Zhao, Hengshuang · Yuan, Zehuan · 柏松 · 白翔

International Journal of Computer Vision 2026

参数信息

FID
5.47
训练成本降低倍数
100

技术优势

不需要外部视觉模块

直接利用任何现成的大语言模型作为基础,无需 CLIP 或扩散模型,简化了架构和训练流程。

训练成本节约 100 倍

以现成 LLM 为底座,显著降低预训练开销,同时多模态能力超越 Chameleon。

视觉语言互相增强

统一的 token 空间使生成和理解任务相互促进,消除了早期模型中常见的干扰。

应用场景