模仿最优控制器,实时生成
以离线深度模仿学习逼近迭代线性二次调节器,针对不稳定系统生成最优轨迹,并支持初始条件优化。
Chen, Bohsun · Lin, Peichun
Advanced Intelligent Systems 2024
神经网络前向传播速度远超迭代优化,因此训练后生成轨迹比 iLQR 快得多。
利用神经网络梯度可通过反向传播优化系统初始条件,这是传统 iLQR 难以做到的。
通过梯度上升找到神经网络性能的最坏界限,确保轨迹在安全范围内。