强化推荐多智能体框架

样本效率更高

一种结合强化推荐采样和群体修正的多智能体深度强化学习框架,能自动为策略训练的不同阶段筛选经验样本,并利用群体奖励调整个体策略以提高最优解能力,可灵活嵌入现有离策略MARL算法。

吴培良 · Liqiang, Tian · Qian, Zhang · 毛秉毅 · 陈雯柏

IEEE Robotics and Automation Letters 2024

技术优势

自动推荐样本

用推荐网络输出采样概率,替代人工采样,能根据不同学习阶段动态调整,提高样本使用效率。

挖掘样本价值

通过强化学习训练推荐网络,使其学会选择能提升系统性能的样本,从而更有效地挖掘回放池中样本的潜在价值。

即插即用

该框架可以嵌入到 MAAC 和 MADDPG 等现有离策略 MARL 算法中,无需大幅改动即可提升样本效率。

应用场景