数据高效
利用多条自举路径缓解值估计偏差,在数据有限时仍能稳定提升策略评估与样本效率。
Zhou, Junjie · Ying, Tian · 任明仑
Machine Learning 2025
通过多种自举目标训练广义Q函数,打破了单一自举路径的偏差累积,从而在有限数据下也能准确估计值函数。
结合保守估计技术,防止价值函数在有限数据下被高估,使策略评估更可靠。
在在线设置下,QGene 能更准确地评估策略,为后续策略改进奠定基础。