知识引导策略网络

先验知识加速学习

一种将不完美的模糊规则知识与深度强化学习框架无缝融合的端到端方法,在保持可解释性的同时,显著提升现有PPO、AC、SAC等算法在离散与连续控制任务中的学习效率。

Yuanqiang, Yu · Zhang, Peng · Kai, Zhao · Zheng, Yan · 郝建业

Autonomous Agents and Multi-Agent Systems 2023

参数信息

任务类型
2

技术优势

学习效率显著提升

将人类先验知识表示为模糊规则控制器,并加入可微调的细化模块,使基础强化学习算法(PPO、AC、SAC)的学习效率显著提升,即使先验知识性能很低。

不完美知识也有效

该框架能够结合次优的人类知识与强化学习,在人类先验知识性能很低的情况下仍能提升算法学习效率。

保持可解释性

通过模糊规则控制器表示知识,策略的可解释性得到保持,有助于理解智能体的决策过程。

即插即用

该框架是端到端的,可直接与PPO、AC、SAC等现有强化学习算法结合,无需大规模改动。

应用场景