LLM引导的飞行控制策略

训练加速

利用大语言模型的世界知识引导强化学习,在有限算力下显著加速六自由度飞行控制策略的训练,实现稳定灵活的控制。

杨梦龙 · Yanqiao, Han · Yang, Ren · Weizheng, Li

IEEE Access 2024

技术优势

训练更快

大语言模型在训练中提供即时反馈并提升交互数据质量,减少训练时间。

稀疏奖励缓解

LLM的局部知识提供直接指导,部分缓解了稀疏奖励问题。

稳定灵活控制

有效奖励函数全面平衡飞机耦合控制,确保稳定灵活的控制。

应用场景