不确定性惩罚RLHF框架

减轻过优化

用多样化LoRA集成量化奖励模型不确定性并惩罚策略模型,可在不牺牲对齐质量的前提下减轻RLHF中的过优化现象。

Zhai, Yuanzhao · Lei, Yu · Han, Zhang · 余跃 · Xu, Kele · 冯大为 · 丁博 · 王怀民

Information Processing and Management 2026

参数信息

OOD AUROC提升
44 %
OOD AUROC提升
31 %
摘要任务提升
12 %
对话任务胜率
56 %

技术优势

量化奖励不确定性

通过多样化LoRA集成,在参数高效的前提下有效量化奖励模型的不确定性,从而在RLHF中惩罚不确定的奖励,减轻过优化。

减轻过优化

将奖励不确定性和KL散度作为正则化项加入RLHF目标,防止策略模型生成高奖励但低质量的内容,从而提升对齐性能。

提升OOD检测

多样化LoRA集成在分布外(OOD)奖励预测上比标准LoRA集成更准确,OOD AUROC提升44%(OPT-330M)和31%(Llama-2-7B)。

下游任务更优

使用UP-RLHF训练的LLM在摘要任务上提升12%,在对话任务上GPT-4评判胜率达56%,优于vanilla RLHF。

应用场景