统一稀疏训练框架

终身DRL轻量化

该框架通过梯度平滑和优先经验采样,使终身深度强化学习模型在保持高性能的同时实现90%稀疏度。

徐梦 · 陳欣鴻 · Weiwei, Fu · Yi-Rong, Lin · Li, Yunghui · Wang, Jianping

IEEE Transactions on Systems, Man, and Cybernetics: Systems 2025

参数信息

稀疏度
90 %

技术优势

少忘事

通过从经验回放缓冲区中优先采样有效的过往经验,缓解灾难性遗忘并促进模型收敛。

泛化不下降

利用锐度感知最小化平滑模型的梯度曲面,在不引入过多计算复杂度的前提下提升泛化能力。

白拿的性能提升

在五种代表性终身DRL方法上达到90%稀疏度,同时所有回合的情景回报和平均回报比稠密模型提高达34%。

应用场景