跨模态摘要领先
该模型通过构建多模态多面图并对齐文本、视觉和音频片段,首次将结构化论文信息与演示材料进行统一编码,显著提升了科学摘要的连贯性和覆盖度。
78263812 · Zusheng, Tan · Fan, Yang · Li, Jing · Gao, Shen · Lam, Wai · Sam, Kwong · Chiu, Billy
Information Sciences 2026
通过无监督对齐和潜在内容分组为文本、视觉、音频片段建立跨模态多层图,使不同模态的结构和语义得到对齐。
通过异构图精炼器和压缩器从多模态图中提炼显著信息,生成面向摘要的表示。
联合文本-图目标函数同时优化摘要质量和图结构一致性。