对抗后缀翻译框架

越狱快百倍

将连续对抗后缀嵌入转化为连贯可读文本,在显著降低计算开销的同时自动生成多样对抗样本,用于强化LLM安全防御。

Hao, Wang · Hao, Li · 黄民烈 · Sha, Lei

2024

参数信息

LLM调用次数
100,000

技术优势

攻击成本大幅降低

将离散优化换成连续嵌入优化,再翻译回可读文本,绕开了对每个候选后缀都做LLM前向的昂贵步骤,因此计算量大幅下降。

生成后缀可读

把连续对抗后缀嵌入转换为连贯可读的文本,不再是一串无意义的token,因此能绕过基于困惑度的过滤器。

攻击成功率更高

在Llama2、Vicuna等模型上使用Advbench数据集测试,攻击成功率显著优于现有技术。

可迁移到黑盒模型

生成的后缀具有迁移性,即使对ChatGPT、Gemini这样的黑盒模型也能成功攻击。

应用场景