动态环境下鲁棒自适应
在可变步态参数和非平稳人机交互条件下,为下肢外骨骼提供比传统DDPG更准确、更稳定的个性化步态轨迹生成与跟踪。
Zhang, Pengfei · 王斌锐 · 刘涛 · Zhang, Bin · 秦菲菲 · Zhang, Yiyi
iScience 2026
自注意力机制让策略网络更有效地利用历史状态信息,训练后的策略能生成更贴合期望的运动轨迹,即使在非平稳交互下仍保持高跟踪精度。
贝叶斯优化自动调整网络超参数,大幅减少了传统深度强化学习中麻烦的手动调参过程,缩短了方案部署时间。