决策提速10倍
一种即插即用的离线强化学习框架,用一步确定性策略替代多步扩散采样,保持性能的同时大幅提升决策速度。
Zhang, Jiazhi · 程玉虎 · Philip Chen, Chun Lung Philip · Hengrui, Zhang · 王雪松
Neural Networks 2025
采用一步确定性策略替代多步去噪,避免了迭代过程。
蒸馏后的策略在D4RL基准上获得更高归一化得分,且标准差更低,说明性能更稳定。
框架无需修改现有扩散策略方法,可直接结合使用。