复杂环境奖励提升2.9倍
集成七项关键增强的I-PPO算法,显著提高样本效率并减少策略震荡,适用于多地形动态环境下无人机目标跟踪。
张涛 · Qingyan, Zhou · 郑跃 · Yu, Huiwen
Knowledge-Based Systems 2025
在平原环境中相比标准PPO,平均累积奖励提升2.9倍,强化学习控制器能更快学会优化跟踪策略。
目标跟踪时长相比标准PPO延长2.7倍,无人机能持续锁定目标车辆而不会频繁丢失。
在山区地形中,奖励方差(IQR)相比DSAC降低38.9%,算法性能波动更小,更适合安全攸关的飞行任务。
在10个智能动态障碍场景下,算法在984时间步内达到稳定收敛,避免了策略发散或震荡。