适应任务突变与AGV故障
该方法将LSTM引入PPO框架以利用时序信息,相较传统规划方法具备更高的动态适应性,并在奖励和收敛速度上优于现有基于PPO的AGV路径规划方法。
蔺一帅 · Gang, Hu · Wang, Liang · 李青山 · 朱家伟
IEEE/CAA Journal of Automatica Sinica 2023
DRL方法通过与环境的持续交互学习,能动态调整路径策略,无需重新规划。
LSTM捕捉时间步信息,提升训练效率,比现有PPO方法收敛更快。