多模态对齐网络

利用大语言模型生成的概念,引导全局与局部语义协同对齐,实现更细粒度的可解释图像识别。

张素兰 · Peijun, Zhang · 胡立华 · Xin, Wen · 张继福

Knowledge-Based Systems 2026

技术优势

细粒度对齐

引入视觉提示机制提取判别性局部区域,与语义概念实现细粒度交互,从而提供更细致可信的视觉解释。

自适应的语义与视觉融合

设计可学习的动态加权机制,根据输入自适应融合全局和局部对齐信息,让模型学会在两者之间分配重要性。

概念去冗余与可验证

通过去冗余和视觉可辨识性验证策略,驱动大语言模型生成高质量、与视觉内容相关的语义概念,为后续对齐奠定可靠基础。

应用场景