视觉语言交互检测器

精准定位虚假区域

一种利用跨模态知识交互来检测多模态虚假信息并定位篡改区域的框架。

Li, Qilei · 高明亮 · Guisheng, Zhang · Zhai, Wenzhe · Jinyong, Chen · Jeon, Gwanggil

Information Fusion 2024

参数信息

精度提升
3.71 %
CF1 提升
2.14 %

技术优势

多模态联合检测

通过视觉-语言嵌入调节器对齐同一语义的跨模态嵌入,并自适应注入跨模态信息,从而同时利用图像和文本中的线索。

精准定位篡改区域

模型不仅判断真假,还指出被篡改的图像区域或文本 token,为审核提供可解释证据。

性能显著提升

在大型基准测试上,ViKI 的精度比现有最优方法提高 3.71%,CF1 提高 2.14%,证明了跨模态交互设计的有效性。

应用场景