消除隐性混杂与偏置
在元强化学习框架中引入用户偏好表示器,同时处理隐性混杂因子与选择/曝光偏置,冷启动下推荐效果显著提升。
刘慧婷 · Xinlong, Lv · 赵鹏 · 李培培 · Wu, Xindong
IEEE Transactions on Multimedia 2025
设计由三个互联门控循环单元组成的用户偏好表示器,在状态编码过程中消除影响用户反馈的隐性混杂因素,使学习到的策略不受未观测混杂干扰。
利用策略网络输出的物品推荐概率作为倾向得分,替代常用的固定倾向得分,根据当前策略动态调整样本权重,更有效地消除选择偏置和曝光偏置。
在元强化学习框架内集成去偏机制,使模型能够从少量交互中快速适应新用户偏好,提高冷启动推荐的准确性。