准确与尽早兼得
用多目标强化学习同时优化辍学预测的准确性与尽早性,突破传统方法只能侧重一端的局限。
Pan, Feng · Hanfei, Zhang · Li, Xuebao · Zhang, Moyu · 纪阳
PeerJ Computer Science 2024
通过向量化奖励函数保持各目标的独特性,避免信息损失,实现更精细的优化。
采用先进的envelope Q-learning技术,全面探索解空间,找到适应多种偏好的Pareto最优策略。
在真实MOOC数据集上经过严格评估,表现优于现有方法。