智能驾驶决策系统

安全探索提升三倍

一种基于近似安全动作的强化学习方法,无需先验知识即可在训练和部署阶段同时提升安全性,并支持探索与安全性的灵活权衡。

王雪松 · Jiazhi, Zhang · Di-Yuan, Hou · 程玉虎

IEEE Transactions on Intelligent Transportation Systems 2023

参数信息

训练安全性提升倍数
>3 倍

技术优势

训练安全性提升三倍

在MetaDrive平台上训练时安全性超过现有最先进强化学习方法三倍,降低训练过程中的事故风险。

无需先验知识

TD3-ASA通过近似安全动作机制直接从交互中学习安全策略,无需人工设计的安全规则或专家示范。

部署风险低

训练得到的安全策略在部署阶段也表现出低风险,适用于真实车辆控制。

应用场景