稳定性贡献采样

样本效率显著提升

一种通过稳定性贡献指数优先化样本的深度强化学习训练方法,可同时提升样本效率与训练稳定性。

Wang, Ziru · Wanli, Jiang · Peng, Ru · Qian, Kou · Wan, Lipeng · 兰旭光

IEEE Transactions on Systems, Man, and Cybernetics: Systems 2025

参数信息

基准环境
2
基准数量
2

技术优势

训练不会崩

SI 按样本对稳定性的影响分配优先级,并在价值损失中加权,推动稳定学习,避免因优先级噪声导致训练发散。

样本效率更高

在两个基准上通过增强训练稳定性显著提升样本效率,无需增加环境交互步数即可获得更高回报。

策略类算法通吃

与离策略和在策略深度强化学习算法均兼容,可直接嵌入现有训练管线而不改变算法框架。

应用场景