CLIP 模态补偿网络

可见光-红外精准匹配

利用文本提示学习从图像中恢复缺失模态信息,同时保留模态特有判别特征,大幅提升跨模态检索精度。

Gang, Hu · Lv, Yafei · Jianting, Zhang · Wu, Qian · Wen, Zaidao

IEEE Transactions on Multimedia 2024

技术优势

补全缺失模态

通过模态补偿模块,结合原始与补偿后的模态特征,获得包含更多判别信息的完整特征表示。

细粒度文本描述

实例文本提示生成模块增强图像与文本的交互,使文本编码器能生成图像的细粒度描述。

灵活模态上下文

模态上下文学习器捕获各模态的独特信息,生成模态特有的上下文令牌,比固定文本描述更灵活。

应用场景