越狱快百倍
将连续对抗后缀嵌入转化为连贯可读文本,在显著降低计算开销的同时自动生成多样对抗样本,用于强化LLM安全防御。
Hao, Wang · Hao, Li · 黄民烈 · Sha, Lei
2024
将离散优化换成连续嵌入优化,再翻译回可读文本,绕开了对每个候选后缀都做LLM前向的昂贵步骤,因此计算量大幅下降。
把连续对抗后缀嵌入转换为连贯可读的文本,不再是一串无意义的token,因此能绕过基于困惑度的过滤器。
在Llama2、Vicuna等模型上使用Advbench数据集测试,攻击成功率显著优于现有技术。
生成的后缀具有迁移性,即使对ChatGPT、Gemini这样的黑盒模型也能成功攻击。