个性化训练蒸馏执行范式

多智能体协同提效

PTDE为每个智能体定制全局信息并蒸馏到局部执行,在SMAC、GRF和LTR基准上均优于现有CTDE算法。

Chen, Yiqun · Mao, Hangyu · 毛佳昕 · Wu, Shiguang · 张天乐 · 张斌 · 75963716 · 常红星

2024

技术优势

无需全局信息执行

训练时将个性化全局信息蒸馏到智能体局部信息中,执行时仅依赖局部信息,性能几乎不降。

即插即用

可直接集成到现有SOTA算法中,无需改动原有架构。

泛化到多类任务

在SMAC、GRF和LTR三个不同类型的基准上均取得显著提升。

应用场景