跨模态交互推理网络

精准分割目标物体

该网络通过文本引导的多模态联合编码与跨图交互定位,强化了视觉与语言特征的深度融合,显著减少了非目标物体的误分割。

徐明珠 · Tianxiang, Xiao · Liu, Yutong · Tang, Haoyu · 胡宇鹏 · 聂礼强

IEEE Transactions on Circuits and Systems for Video Technology 2024

参数信息

整体交并比
67.8 %

技术优势

误分割大幅减少

通过文本引导的多模态联合编码,关键表达被提取并持续引导视觉特征编码,使网络聚焦于正确目标。

关键像素定位更准

跨图交互定位模块在最深层构建多模态图,通过跨图交互与图内推理定位目标关键像素。

分割掩码逐步精化

跨模态注意力增强解码器从粗到细逐步优化目标掩码,增强目标表示。

应用场景