反义词替换对抗攻击算法

攻陷大模型

通过替换语义指示词,生成兼具语义保持与扰动的对抗样本,成功攻击当前主流大模型。

Chenqi, Hua · Xiaojian, Liu · Zhu, Yi · Chaowei, Zhang · Yun, Li · 袁运浩 · 强继朋

Engineering Applications of Artificial Intelligence 2026

技术优势

语义不跑偏

只替换语义指示关键词,并用反义词排序适应上下文,确保原文意思不变。

扰动更有效

显式加入语义扰动约束,避免生成无效对抗样本。

人类不受影响

生成的对抗样本几乎不影响人类理解,可以放心用于测试。

能训练防御

用 SubAttack 生成的样本做对抗训练,让受害者模型更鲁棒。

应用场景