反事实内在奖励

状态探索更准

利用反事实推理从过往探索经历中挖掘事后知识,为智能体分配更准确的内在奖励,引导其高效发现新状态。

Liang, Yuchen · Qinchen, Yang · Zhang, Fukai · 王聪 · Liu, Yue-Hu

Neural Networks 2026

参数信息

性能提升的环境数量
10

技术优势

奖励更准

通过反事实推理将实际探索到的状态与假设执行反事实动作可能到达的状态进行比较,新意更高的状态获得更高奖励,从而纠正不准确的内在奖励。

探索更高效

利用结构性因果模型采样反事实动作并预测其对应状态,在多个连续控制任务中智能体能够更有效地发现新颖状态,从而提升探索效率。

通用性强

在 10 个不同的 OpenAI Gym 环境中均能提升探索性能,表明方法不依赖特定任务细节,可以迁移到多种强化学习场景。

应用场景