降低多步预测误差
通过耦合流最小化真实与学习状态-动作分布差异,缓解基于模型强化学习的累积预测误差,提升长期性能。
Gong, Shengrong · Yi, Wang · Xin, Du · Yuya, Sun · 周立凡 · Zhong, Shan
Engineering Applications of Artificial Intelligence 2025
耦合流损失函数同时充当判别器,选择更准确的 rollout 用于策略学习,并作为奖励信号优化动力学模型,从而减少多步误差。
理论分析建立了期望回报差异的上界,为该方法的性能提供了正式保证。