收敛快五倍
将图变换器与维特比推理引入强化学习策略,为视觉导航提供稠密端到端学习信号,显著提升成功率和泛化能力。
Zhou, Kang · 郭迟 · 张沪寅 · Bohan, Yang
Advanced Engineering Informatics 2023
通过分解强化学习动作,在状态表示中学习自适应先验并在策略中生成基于图变换器维特比的动作,产生稠密端到端学习信号,从而显著减少收敛所需迭代次数。
在策略中探索基于图的潜在最优动作并发现新的物体关系,为策略提供直接指导,弥补传统方法只将先验作为空间特征而缺乏直接策略引导的不足。
代码将公开发布在科学社区中,研究者可以直接获取并集成到已有视觉导航系统,无需从零实现。