帕累托覆盖更广
通过帕累托支配约束抑制多目标对齐中的偏好冲突,使单一策略学习的帕累托前沿覆盖范围显著优于现有方法。
75419178 · Ban, Yikun · 75419180 · Di, Wu · Zixuan, Huang · 王德庆 · Li, Jianxin · Song, Shuangyong
Neurocomputing 2026
每个冲突样本在其原生目标上仍包含有效排序信息,DPOC不是丢弃它,而是按冲突严重程度平滑降权,让信号继续参与训练。
在2目标和3目标的安全对齐与助手基准上,DPOC学到的帕累托曲线覆盖范围比现有方法更广,且独立LLM裁判证实提升非奖励模型伪影。