隐式多模态知识蒸馏框架

零资源对话生成

通过隐式查询Transformer与双向变分信息融合,将视觉隐式知识注入大语言模型,使零资源下生成的对话连贯且富有上下文理解。

Zhang, Bo · 马辉 · Jian, Ding · 王健 · 徐波 · 林鸿飞

Information Fusion 2025

技术优势

零资源也能用

无需大量多模态对话数据,直接从图像-文本对中蒸馏隐式知识,解决了零资源场景下数据稀缺的瓶颈。

对话更懂上下文

通过双向变分信息融合将视觉隐式知识注入大模型,使生成的对话不仅能保持连贯,还能理解视觉上下文中的隐含信息。

效果超过现有模型

在两个对话数据集上的广泛实验表明,该框架生成的高质量对话优于现有最先进模型。

应用场景