离线分词器掩码自编码器
训练加速三十倍
引入离线视觉分词器提供高层语义,该自编码器在加速训练的同时保持与最先进方法相当的性能,使掩码自编码器研究摆脱对超大规模算力的依赖。
国孟昊 · Chen, Wang · Liu, Wei · 胡事民
Computational Visual Media 2025
参数信息
- 训练时间
- 18.8 h
- ImageNet 精度
- 83.6 %
- 加速比
- 31.3 ×
技术优势
训练快 30 倍
离线分词器直接提供高层语义,节省了在线学习 token 的开销。
精度不缩水
在显著加速的同时,达到 83.6% 的精度,与最先进方法相当。
学术圈用得起
把预训练成本降到 8 块 V100 跑不到一天,小课题组也能复现。
应用场景
- 自监督视觉表征:不用标注数据就能学到通用特征,拿来迁移到检测、分割等任务。
- 高效视觉预训练:把预训练成本降低 30 倍,让更多研究者能从头训练自己的模型。
- 低算力视觉模型:用 8 块 V100 跑不到一天,小算力团队也能做大规模预训练。
- 边缘设备视觉:更高效的预训练方法降低模型迭代门槛,促进边缘侧轻量模型发展。