损失梯度双平衡
对损失做对数变换、对梯度按最大范数归一,从两个角度同时抑制任务间尺度失衡,在多个基准上稳定优于现有方法。
Baijiong, Lin · Feiyang, Ye · 张宇 · Chen, Yingcong · 刘姝 · Tsang, Ivor W. · Kwok, James T.
Neural Networks 2025
同时从损失和梯度两个层面入手,损失做对数变换,梯度按最大范数归一,避免了单一视角的局限。
对每个任务的损失进行对数变换,大幅压缩不同任务损失间的数量级差异,使各任务在训练中得到更公平的对待。
通过将所有任务梯度归一化到以最大梯度范数为基准的可比尺度,防止某个任务梯度主导训练过程。
在多个基准数据集上的一致性能提升表明方法具有普适性,不依赖特定任务组合。