双重增强元强化学习

稀疏奖励下训练更稳

结合演示引导与偏移探索,让智能体在奖励稀少的任务中更快学会并适应新环境。

Haorui, Li · Liang, Jiaqi · Xiaoxuan, Wang · Chengzhi, Jiang · 李林静 · Zeng, Daniel Danjun

Complex and Intelligent Systems 2025

技术优势

支持最优与次优演示

在训练和适应阶段均优于现有方法

包含消融与敏感性分析验证

演示质量可迭代提升