稳定反馈提性能
用监督模型替代直接随机反馈,显著提升无模型强化学习在推荐系统中的性能。
Cai, Tianchi · Shenliao, Bao · Jiyan, Jiang · Zhou, Shiji · Wenpeng, Zhang · Gu, Lihong · Gu, Jinjie · Zhang, Guannan
2023
用监督模型预测的稳定反馈替代直接随机反馈,避免了随机波动对学习过程的干扰。
框架可以灵活使用各种监督模型,不局限于特定架构。
在模拟器和工业级推荐系统上均优于不同的基于RL的基线方法。