分层强化学习控制器

群机对抗胜率九成

将混杂决策解耦为离散分配与连续规划两层,并以概率集成模型量化不确定性,自适应调节层间交互频率。

Qizhen, Wu · 刘克新 · Chen, Lei · Jinhu, Lu

IEEE Transactions on Automation Science and Engineering 2024

参数信息

胜率
90 %

技术优势

应对不确定性

通过概率集成模型量化不确定性,并自适应调节两层之间的交互频率,从而在高度不确定的对抗环境中保持性能。

稳定训练过程

采用预训练和交叉训练相结合的训练方法,克服两层结构带来的训练不稳定问题,提升训练效率和稳定性。

应用场景