保守估计Q函数
通过整合on-policy SARSA风格,为离线Actor-Critic方法提供悲观保守的Q函数估计,从而在静态数据集上实现稳定且鲁棒的策略学习。
Shuo, Cao · 王雪松 · 程玉虎
IEEE/CAA Journal of Automatica Sinica 2024
通过on-policy SARSA风格的bootstrap动作构建保守Q函数,降低了外推误差,使得Q函数估计更加稳定。
在D4RL Gym-MuJoCo基准测试中,该方法优于现有最先进离线强化学习方法至少15%,表明其学习到的策略更加鲁棒有效。
即使在有限数据采样误差下,该方法学习的Q函数仍能收敛,且其与真实Q值之间的偏差上界可控。