自适应逆最优控制器
仅用状态与输入数据
无需系统动力学先验,在线学习人类最优控制行为并用于模仿,消除了持续激励条件限制。
Wang, Mi · 吴淮宁
IEEE Transactions on Automation Science and Engineering 2024
技术优势
无需系统模型
在动力学完全未知的情况下,仅通过状态和控制输入即可在线学习人类的最优控制行为。
摆脱持续激励限制
自适应积分并发学习算法在线辨识系统矩阵和人类反馈增益,不需要满足传统持续激励条件。
在线学习,实时模仿
算法在线实现,仅需有限数据即可让机器在陌生环境中复现人类的最优控制器。
应用场景
- 服务机器人行为学习:让服务机器人从人类示教中学习最优行为,无需系统模型,在线适应新环境。
- 人机协作控制:通过在线学习人类控制策略,使机器人能够理解和模仿人类操作,改善人机协作。
- 智能车辆车道保持:可从驾驶员操作数据中学习偏好评判标准,使车道保持辅助系统更符合人类意图。
- 康复机器人控制:从患者示范动作中学习最优控制,使康复机器人能模拟治疗师手法。
- 人形机器人模仿学习:仅通过状态和输入数据在线学习人类行为,让人形机器人在新环境复现相似的最优控制器。