社交导航安全RL算法

安全与效率最优平衡

提出置信感知的鲁棒动态距离约束,在人群密集场景下实现无碰撞且流畅的机器人导航。

Zhu, Kai · 薛涛 · 张涛

IEEE Transactions on Automation Science and Engineering 2025

技术优势

不会碰撞

通过可达性安全强化学习保证状态级安全,对可行部分提供安全保证,对不可行部分最小化风险,从而避免碰撞。

不会冻结

将鲁棒动态距离约束设为累积形式而非逐状态无形状代价,避免过于保守的策略导致机器人停在原地。

更安全且高效

在仿真和虚拟现实评估中,成功率、碰撞能量等指标均优于现有方法,实现安全与效率的最佳折中。

真实可用

所获策略在仿真和真实世界实验中均表现出期望的避障行为,验证了可迁移性。

应用场景