公平折衷可兼得
针对多目标强化学习提出通用框架,支持随机策略学习与差异化用户权益,在多用户与多准则场景下优于单目标奖励工程。
Qian, J. · Siddique, Umer · Guanbao, Yu · Weng, Paul
Neural Computing and Applications 2025
通过凹函数聚合期望向量回报,统一多用户公平与多准则折衷优化。
扩展的DQN可以学习随机策略,这对多目标RL至关重要。
实验结果表明本方法在多用户和多准则场景下优于手工设计奖励的单目标RL。
框架扩展了公平优化,允许不同用户拥有不同权益。