保真度提升26%
通过抽象训练与面向抽象的聚类,构建高保真且解释友好的抽象策略图,同时保持竞争力奖励。
Shi, Peng · Liu, Si · Dapeng, Zhi · Wang, Peixin · Xu, Chenyang · 陈成 · 张敏
Neural Networks 2025
更大的聚类规模对应更高保真度,抽象训练扩大了每个聚类的范围。
同一聚类内的状态对应同一动作,用户能更准确地预测策略行为。
在提高保真度的同时,依然保持有竞争力的奖励水平。