并行强化学习控制器

学习加速近邻压缩

带理论保证的轻量并行方案,统一协调多个控制器快速逼近最优代价函数,无需复杂同步机制即可提升数据效率。

王鼎 · Jiangyu, Wang · Hu, Lingzhi · 张利国

IEEE Transactions on Systems, Man, and Cybernetics: Systems 2024

技术优势

理论保证

全局指标继承了一类迭代强化学习算法的理论收敛保障,无需额外的严格假设即可确保性能。

学习加速

通过全局指标的引导和通信,并行控制器能快速压缩最优代价函数的邻域,减少收敛所需迭代次数。

数据效率高

基于值迭代和Q学习的两种并行算法通过不同扩展提高了数据效率,比单控制器更充分利用样本。

应用场景