多模态图网络

跨模态摘要领先

该模型通过构建多模态多面图并对齐文本、视觉和音频片段,首次将结构化论文信息与演示材料进行统一编码,显著提升了科学摘要的连贯性和覆盖度。

78263812 · Zusheng, Tan · Fan, Yang · Li, Jing · Gao, Shen · Lam, Wai · Sam, Kwong · Chiu, Billy

Information Sciences 2026

技术优势

文本、视觉、音频实现统一建模

通过无监督对齐和潜在内容分组为文本、视觉、音频片段建立跨模态多层图,使不同模态的结构和语义得到对齐。

异构图提炼关键信息

通过异构图精炼器和压缩器从多模态图中提炼显著信息,生成面向摘要的表示。

联合训练兼顾质量与结构

联合文本-图目标函数同时优化摘要质量和图结构一致性。

应用场景