分层强化学习动作抽象

自主分解复杂任务

利用选项框架无需预先指定子任务即可自主分解复杂任务,并通过双向注意力机制精确估计状态-动作价值以缓解部分可观测性。

Zhu, Anjie · 何泓材 · Yongjun, Yang · Zheng, Zetao · 邵杰

IEEE Transactions on Consumer Electronics 2024

技术优势

不用预定义子任务

通过选项框架自动将复杂任务分解为时间上扩展的宏动作,消除了对手工设计任务层级的需求。

不需要人类演示数据

无需从人类游戏记录中预训练或模仿,直接从环境交互中学习宏观动作,减少了数据准备的工作量。

可缓解部分可观测问题

双向注意力机制让状态与动作互相强化表示,在只能获得部分信息时仍能更准地估计状态-动作价值。

应用场景