多目标强化学习预测

准确与尽早兼得

用多目标强化学习同时优化辍学预测的准确性与尽早性,突破传统方法只能侧重一端的局限。

Pan, Feng · Hanfei, Zhang · Li, Xuebao · Zhang, Moyu · 纪阳

PeerJ Computer Science 2024

技术优势

两个目标一起优化

通过向量化奖励函数保持各目标的独特性,避免信息损失,实现更精细的优化。

探索更全的折中方案

采用先进的envelope Q-learning技术,全面探索解空间,找到适应多种偏好的Pareto最优策略。

真实数据得到验证

在真实MOOC数据集上经过严格评估,表现优于现有方法。

应用场景