多模态生成式填补网络

提升 61%

利用文本辅助信息,在高缺失率下仍能保持高精度图像填补。

马千 · Yuan, Guo · Jinlei, Zhang · Haochen, Zhang · Guo, Shikai · 宁博 · 谷峪 · 于戈

Information Sciences 2025

参数信息

峰值性能提升
61.0 %
峰值性能提升
52.5 %
峰值性能提升
54.6 %
最低性能提升
39.5 %
最低性能提升
38.2 %
最低性能提升
35.2 %

技术优势

高缺失率下依然稳

引入文本模态提供额外语义线索,弥补高缺失率时图像自身信息的不足。

文本辅助,精度大幅提升

跨模态特征学习子网融合文本与图像特征,使填补结果更接近真实像素。

三数据集验证,提升显著

在 Flickr8k、Flickr30k 和 COCO 上峰值提升分别达 52.5%、61.0%、54.6%。

应用场景