样本效率显著提升
一种通过稳定性贡献指数优先化样本的深度强化学习训练方法,可同时提升样本效率与训练稳定性。
Wang, Ziru · Wanli, Jiang · Peng, Ru · Qian, Kou · Wan, Lipeng · 兰旭光
IEEE Transactions on Systems, Man, and Cybernetics: Systems 2025
SI 按样本对稳定性的影响分配优先级,并在价值损失中加权,推动稳定学习,避免因优先级噪声导致训练发散。
在两个基准上通过增强训练稳定性显著提升样本效率,无需增加环境交互步数即可获得更高回报。
与离策略和在策略深度强化学习算法均兼容,可直接嵌入现有训练管线而不改变算法框架。