耦合流策略优化算法

降低多步预测误差

通过耦合流最小化真实与学习状态-动作分布差异,缓解基于模型强化学习的累积预测误差,提升长期性能。

Gong, Shengrong · Yi, Wang · Xin, Du · Yuya, Sun · 周立凡 · Zhong, Shan

Engineering Applications of Artificial Intelligence 2025

技术优势

多步误差更小

耦合流损失函数同时充当判别器,选择更准确的 rollout 用于策略学习,并作为奖励信号优化动力学模型,从而减少多步误差。

理论上有保证

理论分析建立了期望回报差异的上界,为该方法的性能提供了正式保证。

应用场景