训练加速
利用大语言模型的世界知识引导强化学习,在有限算力下显著加速六自由度飞行控制策略的训练,实现稳定灵活的控制。
杨梦龙 · Yanqiao, Han · Yang, Ren · Weizheng, Li
IEEE Access 2024
大语言模型在训练中提供即时反馈并提升交互数据质量,减少训练时间。
LLM的局部知识提供直接指导,部分缓解了稀疏奖励问题。
有效奖励函数全面平衡飞机耦合控制,确保稳定灵活的控制。