攻陷大模型
通过替换语义指示词,生成兼具语义保持与扰动的对抗样本,成功攻击当前主流大模型。
Chenqi, Hua · Xiaojian, Liu · Zhu, Yi · Chaowei, Zhang · Yun, Li · 袁运浩 · 强继朋
Engineering Applications of Artificial Intelligence 2026
只替换语义指示关键词,并用反义词排序适应上下文,确保原文意思不变。
显式加入语义扰动约束,避免生成无效对抗样本。
生成的对抗样本几乎不影响人类理解,可以放心用于测试。
用 SubAttack 生成的样本做对抗训练,让受害者模型更鲁棒。