随机丢权对抗训练

GLUE 全面提分

通过在权重上施加最坏扰动并随机丢弃部分扰动,扩大对抗攻击空间,从而提升模型的泛化能力。

Ni, Shiwen · Li, Jiawen · Min, Yang · Kao, Hung-Yu

IEEE/ACM Transactions on Audio Speech and Language Processing 2023

参数信息

BERT-base GLUE 总体分数
79.7

技术优势

GLUE 提分

权重上同时施加最坏扰动和随机丢弃,扩大了对抗攻击的组合空间,从而降低内部对抗风险,提升模型泛化能力。

微调就能提分

仅在微调阶段应用 DropAttack,无需从头训练,即可显著提升预训练模型在 GLUE 上的总体分数。

能从零训练

对于随机初始化的模型,DropAttack 同样能显著提升性能。

应用场景