严格最佳响应自博弈算法

收敛至评估偏好策略

一种保证学习结果与图基评估指标偏好一致的对称博弈自博弈算法,用响应有向图上的行走建模学习过程,消除评估与学习脱节。

Yan, Rui · Zhang, Weixian · 邓瑞良 · 段晓明 · 石宗英 · 钟宜生

Information Sciences 2023

技术优势

有收敛保证

将学习过程建模为联合策略响应图上的行走,在满足条件时能证明收敛到评估偏好策略。

填补评估与学习鸿沟

所提算法直接针对评估与学习脱节问题,确保学习结果与评估指标一致。

提供两种评估指标

基于汇均衡引入两种图基指标,刻画策略评估中的偏好策略,并分析二者关系。

应用场景