可见光-红外精准匹配
利用文本提示学习从图像中恢复缺失模态信息,同时保留模态特有判别特征,大幅提升跨模态检索精度。
Gang, Hu · Lv, Yafei · Jianting, Zhang · Wu, Qian · Wen, Zaidao
IEEE Transactions on Multimedia 2024
通过模态补偿模块,结合原始与补偿后的模态特征,获得包含更多判别信息的完整特征表示。
实例文本提示生成模块增强图像与文本的交互,使文本编码器能生成图像的细粒度描述。
模态上下文学习器捕获各模态的独特信息,生成模态特有的上下文令牌,比固定文本描述更灵活。