SARViT视觉Transformer

卫星端实时处理

面向SAR图像解释的大规模视觉Transformer,经知识蒸馏压缩至36M参数,在场景分类、目标检测与建筑分割任务上达到SOTA,同时大幅降低计算开销,适配星上实时处理。

Jian, Ma · Zhang, Hao · Wang, Zhengjue · Zhibing, Wang

IET Conference Proceedings 2023

参数信息

参数量(压缩后)
36 M

技术优势

参数压到九分之一

采用知识蒸馏,从320M压缩到36M,计算和内存显著下降,仍保留良好表征能力。

下游任务全SOTA

场景分类、目标检测、建筑分割均达到当前最优,验证了ViT用于SAR图像的潜力。

压缩后仍具竞争力

压缩模型在精度和计算复杂度上与现有方法相比仍具竞争力,满足实时处理要求。

应用场景