记忆增强视觉Transformer

类增量精度反超

用记忆增强注意力取代架构扩张,在持续学习中兼顾稳定与可塑性,参数开销极小。

尼博琳 · Xing, Nie · Zhang, Chenghao · Shixiong, Xu · Xin, Zhang · 孟高峰 · 向世明

IEEE Transactions on Circuits and Systems for Video Technology 2024

参数信息

平均准确率提升
+3.74 %

技术优势

精度反超

通过记忆增强注意力重用历史知识,在ImageNet-100 10任务设定下平均准确率提升+3.74%。

参数不涨

采用轻量记忆库而非架构扩张,模型参数量少于现有最优方法,便于部署。

训练更稳

记忆库存储键值投影,促使模型利用已学知识,以边际成本增强训练稳定性。

应用场景