该模型通过图像和文本间的跨模态与模态内知识迁移,增强文本中的身份知识,并利用知识精炼器保留身份信息、丢弃无关信息,从而提升基于语言的人员搜索性能。
Wu, Ziqiang · 马丙鹏 · Hong, Chang · Shiguang, Shan
IEEE Transactions on Multimedia 2023
通过跨模态知识迁移,从图像中提取身份信息补入文本,解决文本知识不足的问题。
同一图像对应多个文本时,模态内知识迁移可整合更多身份信息,增强文本表征。
知识精炼器在迁移后保留身份信息、丢弃无关知识,避免噪声损害匹配精度。
在 Flickr30K、CUB、Flowers 上验证了良好的泛化能力,不仅限于行人搜索场景。