无需人工调参
通过遗憾最小化自动发现奖励函数,加速策略优化并提高具身智能体在多样任务中的适应性。
卢仁智 · Zonghe, Shao · Ding, Yuemin · 陈蕊娟 · 伍冬睿 · 苏厚胜 · 杨涛 · Zhang, Fumin · 王钧 · Shi, Yang · Zhong-Ping, Jiang · 丁汉 · 张海涛
Nature Communications 2025
通过双层优化和遗憾最小化自动发现奖励函数,省去了人工设计过程。
所发现的奖励函数能提高智能体在多样任务中的适应性,无需为每个任务单独调参。
该方法加速策略优化,减少训练时间。