多目标深度强化学习算法

公平折衷可兼得

针对多目标强化学习提出通用框架,支持随机策略学习与差异化用户权益,在多用户与多准则场景下优于单目标奖励工程。

Qian, J. · Siddique, Umer · Guanbao, Yu · Weng, Paul

Neural Computing and Applications 2025

技术优势

通用框架

通过凹函数聚合期望向量回报,统一多用户公平与多准则折衷优化。

支持随机策略

扩展的DQN可以学习随机策略,这对多目标RL至关重要。

优于奖励工程

实验结果表明本方法在多用户和多准则场景下优于手工设计奖励的单目标RL。

支持不同权益

框架扩展了公平优化,允许不同用户拥有不同权益。

应用场景