安全探索提升三倍
一种基于近似安全动作的强化学习方法,无需先验知识即可在训练和部署阶段同时提升安全性,并支持探索与安全性的灵活权衡。
王雪松 · Jiazhi, Zhang · Di-Yuan, Hou · 程玉虎
IEEE Transactions on Intelligent Transportation Systems 2023
在MetaDrive平台上训练时安全性超过现有最先进强化学习方法三倍,降低训练过程中的事故风险。
TD3-ASA通过近似安全动作机制直接从交互中学习安全策略,无需人工设计的安全规则或专家示范。
训练得到的安全策略在部署阶段也表现出低风险,适用于真实车辆控制。