偏好强化学习路径跟踪控制器

免设计奖励函数

一种直接从人类偏好中学习控制策略的深度强化学习方法,绕过了传统RL中繁琐的奖励函数设计,提高了水下机器人在复杂海洋环境中的自主作业能力。

Shilong, Niu · Xingwei, Pan · Jun, Wang · 李光亮

Ocean Engineering 2025

参数信息

in three tasks
2 D

技术优势

免奖励函数设计

通过人类偏好训练的奖励预测器学习控制策略,无需手动设计奖励函数,从而减少对专家知识的依赖。

优于主流基线算法

在三个路径跟踪任务中均显著优于PPO和GAIL算法,证明偏好学习在复杂任务中优于传统奖励设计和示范学习。

适用于多种任务

在2D直线、2D正弦曲线和3D直线路径跟踪任务中均表现良好,展示了跨任务泛化能力。

应用场景