减轻过优化
用多样化LoRA集成量化奖励模型不确定性并惩罚策略模型,可在不牺牲对齐质量的前提下减轻RLHF中的过优化现象。
Zhai, Yuanzhao · Lei, Yu · Han, Zhang · 余跃 · Xu, Kele · 冯大为 · 丁博 · 王怀民
Information Processing and Management 2026
通过多样化LoRA集成,在参数高效的前提下有效量化奖励模型的不确定性,从而在RLHF中惩罚不确定的奖励,减轻过优化。
将奖励不确定性和KL散度作为正则化项加入RLHF目标,防止策略模型生成高奖励但低质量的内容,从而提升对齐性能。
多样化LoRA集成在分布外(OOD)奖励预测上比标准LoRA集成更准确,OOD AUROC提升44%(OPT-330M)和31%(Llama-2-7B)。
使用UP-RLHF训练的LLM在摘要任务上提升12%,在对话任务上GPT-4评判胜率达56%,优于vanilla RLHF。