改进型PPO无人机跟踪算法(I-PPO)

复杂环境奖励提升2.9倍

集成七项关键增强的I-PPO算法,显著提高样本效率并减少策略震荡,适用于多地形动态环境下无人机目标跟踪。

张涛 · Qingyan, Zhou · 郑跃 · Yu, Huiwen

Knowledge-Based Systems 2025

参数信息

平均累积奖励提升倍数
2.9 ×
目标跟踪时长延长倍数
2.7 ×
奖励方差降低幅度
38.9 %
稳定收敛时间
984 time units

技术优势

奖励提升近三倍

在平原环境中相比标准PPO,平均累积奖励提升2.9倍,强化学习控制器能更快学会优化跟踪策略。

跟踪时长延长2.7倍

目标跟踪时长相比标准PPO延长2.7倍,无人机能持续锁定目标车辆而不会频繁丢失。

山区鲁棒性显著增强

在山区地形中,奖励方差(IQR)相比DSAC降低38.9%,算法性能波动更小,更适合安全攸关的飞行任务。

密集障碍下稳定收敛

在10个智能动态障碍场景下,算法在984时间步内达到稳定收敛,避免了策略发散或震荡。

应用场景