多模态虚拟场景催眠

通过欺骗性叙事框架实现多模态提示注入,能绕过视觉语言模型的安全对齐机制,诱导有害回答。

Shi, Xiayang · Shangfeng, Chen · Gang, Zhang · Wei, Wei · 李寅霖 · Fan, Zhaoxin · Jingjing, Liu

Pattern Recognition 2026

参数信息

越狱成功率
82 %

技术优势

同时攻击图像与文本

通过优化字体设计将恶意文本转为视觉布局,并用加密信息掩盖上下文学习,从而绕过多模态安全对齐。

自动化评估省人力

利用LLM和精心设计的提示模板自动评估越狱成功率,避免了人工审查大量攻击响应。

应用场景