学习加速近邻压缩
带理论保证的轻量并行方案,统一协调多个控制器快速逼近最优代价函数,无需复杂同步机制即可提升数据效率。
王鼎 · Jiangyu, Wang · Hu, Lingzhi · 张利国
IEEE Transactions on Systems, Man, and Cybernetics: Systems 2024
全局指标继承了一类迭代强化学习算法的理论收敛保障,无需额外的严格假设即可确保性能。
通过全局指标的引导和通信,并行控制器能快速压缩最优代价函数的邻域,减少收敛所需迭代次数。
基于值迭代和Q学习的两种并行算法通过不同扩展提高了数据效率,比单控制器更充分利用样本。