零资源对话生成
通过隐式查询Transformer与双向变分信息融合,将视觉隐式知识注入大语言模型,使零资源下生成的对话连贯且富有上下文理解。
Zhang, Bo · 马辉 · Jian, Ding · 王健 · 徐波 · 林鸿飞
Information Fusion 2025
无需大量多模态对话数据,直接从图像-文本对中蒸馏隐式知识,解决了零资源场景下数据稀缺的瓶颈。
通过双向变分信息融合将视觉隐式知识注入大模型,使生成的对话不仅能保持连贯,还能理解视觉上下文中的隐含信息。
在两个对话数据集上的广泛实验表明,该框架生成的高质量对话优于现有最先进模型。