随机奖励稳定框架

稳定反馈提性能

用监督模型替代直接随机反馈,显著提升无模型强化学习在推荐系统中的性能。

Cai, Tianchi · Shenliao, Bao · Jiyan, Jiang · Zhou, Shiji · Wenpeng, Zhang · Gu, Lihong · Gu, Jinjie · Zhang, Guannan

2023

技术优势

反馈更稳定

用监督模型预测的稳定反馈替代直接随机反馈,避免了随机波动对学习过程的干扰。

模型无关

框架可以灵活使用各种监督模型,不局限于特定架构。

性能超越基线

在模拟器和工业级推荐系统上均优于不同的基于RL的基线方法。

应用场景