精准定位虚假区域
一种利用跨模态知识交互来检测多模态虚假信息并定位篡改区域的框架。
Li, Qilei · 高明亮 · Guisheng, Zhang · Zhai, Wenzhe · Jinyong, Chen · Jeon, Gwanggil
Information Fusion 2024
通过视觉-语言嵌入调节器对齐同一语义的跨模态嵌入,并自适应注入跨模态信息,从而同时利用图像和文本中的线索。
模型不仅判断真假,还指出被篡改的图像区域或文本 token,为审核提供可解释证据。
在大型基准测试上,ViKI 的精度比现有最优方法提高 3.71%,CF1 提高 2.14%,证明了跨模态交互设计的有效性。