提升 61%
利用文本辅助信息,在高缺失率下仍能保持高精度图像填补。
马千 · Yuan, Guo · Jinlei, Zhang · Haochen, Zhang · Guo, Shikai · 宁博 · 谷峪 · 于戈
Information Sciences 2025
引入文本模态提供额外语义线索,弥补高缺失率时图像自身信息的不足。
跨模态特征学习子网融合文本与图像特征,使填补结果更接近真实像素。
在 Flickr8k、Flickr30k 和 COCO 上峰值提升分别达 52.5%、61.0%、54.6%。