稀疏奖励下训练更稳
结合演示引导与偏移探索,让智能体在奖励稀少的任务中更快学会并适应新环境。
Haorui, Li · Liang, Jiaqi · Xiaoxuan, Wang · Chengzhi, Jiang · 李林静 · Zeng, Daniel Danjun
Complex and Intelligent Systems 2025
支持最优与次优演示
在训练和适应阶段均优于现有方法
包含消融与敏感性分析验证
演示质量可迭代提升