策略学习大幅提速
以大语言模型蒸馏先验知识来加速多智能体策略学习,并通过悲观贝尔曼算子与行为克隆损失共同缓解价值高估,对任务难度与环境变化更具鲁棒性。
Liqiang, Tian · 吴培良 · Qian, Zhang · 毛秉毅 · 陈雯柏
Neurocomputing 2026
通过知识蒸馏将LLM的先验知识传递给智能体,使其无需从头探索,从而加快策略收敛。
构造悲观贝尔曼算子并引入行为克隆损失,抑制价值高估和次优性,提升学习稳定性。
在不同任务环境中,结合EMAP-LLM的MARL算法相较于基线在策略学习速度上优势更显著,且对任务难度和环境变化具有更好的鲁棒性。