收敛至评估偏好策略
一种保证学习结果与图基评估指标偏好一致的对称博弈自博弈算法,用响应有向图上的行走建模学习过程,消除评估与学习脱节。
Yan, Rui · Zhang, Weixian · 邓瑞良 · 段晓明 · 石宗英 · 钟宜生
Information Sciences 2023
将学习过程建模为联合策略响应图上的行走,在满足条件时能证明收敛到评估偏好策略。
所提算法直接针对评估与学习脱节问题,确保学习结果与评估指标一致。
基于汇均衡引入两种图基指标,刻画策略评估中的偏好策略,并分析二者关系。