免设计奖励函数
一种直接从人类偏好中学习控制策略的深度强化学习方法,绕过了传统RL中繁琐的奖励函数设计,提高了水下机器人在复杂海洋环境中的自主作业能力。
Shilong, Niu · Xingwei, Pan · Jun, Wang · 李光亮
Ocean Engineering 2025
通过人类偏好训练的奖励预测器学习控制策略,无需手动设计奖励函数,从而减少对专家知识的依赖。
在三个路径跟踪任务中均显著优于PPO和GAIL算法,证明偏好学习在复杂任务中优于传统奖励设计和示范学习。
在2D直线、2D正弦曲线和3D直线路径跟踪任务中均表现良好,展示了跨任务泛化能力。