推荐多样性最优
采用多智能体强化学习框架,通过动态经验回放和特征熵值估计,在提升推荐多样性的同时保持高准确率。
Zihan, Wang · 冯时 · 王大玲 · Song, Kaisong · Gang, Wu · 张一飞 · Han, Zhao · Ge, Yu
Knowledge and Information Systems 2025
多智能体协作扩大了动作空间探索,使推荐结果不再集中于热门项目。
动态经验回放保证每个学习批次都包含长尾样本,维持对少见特征的关注。
在价值估计中引入特征熵,鼓励探索更多样的用户偏好特征。