离线分词器掩码自编码器

训练加速三十倍

引入离线视觉分词器提供高层语义,该自编码器在加速训练的同时保持与最先进方法相当的性能,使掩码自编码器研究摆脱对超大规模算力的依赖。

国孟昊 · Chen, Wang · Liu, Wei · 胡事民

Computational Visual Media 2025

参数信息

训练时间
18.8 h
ImageNet 精度
83.6 %
加速比
31.3 ×

技术优势

训练快 30 倍

离线分词器直接提供高层语义,节省了在线学习 token 的开销。

精度不缩水

在显著加速的同时,达到 83.6% 的精度,与最先进方法相当。

学术圈用得起

把预训练成本降到 8 块 V100 跑不到一天,小课题组也能复现。

应用场景