一个开源的多模态大语言模型,通过强大的视觉编码器和动态高分辨率处理,在多项多模态基准上取得了与商业闭源模型相当的性能。
Zhe, Chen · Weiyun, Wang · Tian, Hao · Shenglong, Ye · Zhangwei, Gao · Erfei, Cui · Wenwen, Tong · Kongzhi, Hu · Jiapeng, Luo · Zheng, Ma · Ji, Ma · Wang, Jiaqi · Dong, Xiaoyi · Yan, Hang · Hewei, Guo · He, Conghui · Shi, Botian · Zhenjiang, Jin · Chao, Xu · Bin, Wang · Xingjian, Wei · 76372066 · Wenjian, Zhang · Bo, Zhang · Cai, Pinlong · Wen, Licheng · Xiangchao, Yan · Min, Dou · Lu, Lewei · Zhu, Xizhou · 路通 · Lin, Dahua · Yu, Qiao · Dai, Jifeng · 王文海
Science China Information Sciences 2024
图像按宽高比和分辨率切成 1 到 40 个 448×448 的块,支持 4K 输入,细节不丢。
精心收集的中英双语数据集覆盖常见场景和文档图像,显著提升 OCR 和中文任务。
InternViT-6B 通过持续学习策略提升视觉理解,可迁移到不同 LLM 中复用。