多目标即时平衡
先学各辅助目标,再学主策略并保持接近,同时优化主指标与多种用户交互。
Qingpeng, Cai · Xue, Zhenghai · Chi, Zhang · Wanqi, Xue · Liu, Shuchang · Zhan, Ruohan · Xueliang, Wang · Tianyou, Zuo · Wentao, Xie · Dong, Zheng · Jiang, Peng · 盖坤
2023
第二阶段的策略被约束在接近第一阶段学到的各辅助策略,从而保证辅助目标性能。