收敛快且抗扰强
一种预训练结合事件触发采样的深度强化学习控制器,显著降低了无人艇路径跟随的稳态误差并提升响应速度。
Jiaxuan, Liu · 肖长诗 · 元海文 · Changlong, Li · Li, Qiliang
Ocean Engineering 2025
用预训练网络替代初始策略网络,早期阶段就具备较好控制能力。
事件触发机制识别干扰的显著变化并激活对应采样策略,让控制器及时响应环境改变。
训练好的模型可以通过后续微调适应不同条件和任务,无需从头训练。