通过欺骗性叙事框架实现多模态提示注入,能绕过视觉语言模型的安全对齐机制,诱导有害回答。
Shi, Xiayang · Shangfeng, Chen · Gang, Zhang · Wei, Wei · 李寅霖 · Fan, Zhaoxin · Jingjing, Liu
Pattern Recognition 2026
通过优化字体设计将恶意文本转为视觉布局,并用加密信息掩盖上下文学习,从而绕过多模态安全对齐。
利用LLM和精心设计的提示模板自动评估越狱成功率,避免了人工审查大量攻击响应。