不增数据提升泛化
在SFT之后引入在线强化学习,通过自动采样多条推理路径并利用真实答案生成奖励,显著增强了模型的泛化能力。
Trung Quoc, Luong · Xinbo, Zhang · Jie, Zhanming · Peng, Sun · Xiaoran, Jin · Li, Hang
2024
ReFT在给定问题下自动采样大量推理路径,从而从多样的推理轨迹中学习,增强了泛化能力。
ReFT仅使用与SFT相同的训练问题就获得了提升,无需额外或增强的训练数据,显示出优越的泛化能力。
ReFT与多数投票或重排序等推理时策略结合后,性能可以进一步提升。