终身DRL轻量化
该框架通过梯度平滑和优先经验采样,使终身深度强化学习模型在保持高性能的同时实现90%稀疏度。
徐梦 · 陳欣鴻 · Weiwei, Fu · Yi-Rong, Lin · Li, Yunghui · Wang, Jianping
IEEE Transactions on Systems, Man, and Cybernetics: Systems 2025
通过从经验回放缓冲区中优先采样有效的过往经验,缓解灾难性遗忘并促进模型收敛。
利用锐度感知最小化平滑模型的梯度曲面,在不引入过多计算复杂度的前提下提升泛化能力。
在五种代表性终身DRL方法上达到90%稀疏度,同时所有回合的情景回报和平均回报比稠密模型提高达34%。