LoRA-INT8 Whisper 模型

粤语识别边缘可用

将 Whisper 用 LoRA 和 INT8 量化压到 60 MB,错误率接近全参微调,推理速度提升数倍。

Lusheng, Zhang · 吴世娥 · 王中训

Sensors 2025

参数信息

字符错误率
11.1 %
全参微调CER
10.3 %
训练参数占比
1.6 %
模型大小
60 MB
实时因子
0.20
延迟降幅
43 %
实时因子(GPU)
0.06

技术优势

训练便宜一个量级

LoRA 只更新 1.6% 的权重,训练显存和计算开销比全参微调降低约一个数量级,模型还保持了接近全参微调的识别精度。

手机CPU也够快

量化后的 60 MB INT8 模型在 MacBook Pro M1 Max CPU 上离线识别约 5 倍实时,延迟比 FP16 基线低 43%,不必依赖专用加速卡。

接近全参微调效果

LoRA 微调后的 CER 为 11.1%,和全参微调的 10.3% 只差不到一个百分点,但训练代价小得多。

应用场景