轻量神经语音编解码器

实时个性化语音通信

同时实现高质量语音压缩与低时延个性化语音转换,大幅降低模型复杂度,保障语音版权安全。

Xusheng, Yang · Wei, Xiao · Zixiang, Wang · Ge, Meng · Shang, Shidong · 邹月娴

Neural Networks 2026

参数信息

模型参数缩减
38 ×
语音质量(ViSQOL)
4.32
语音适应时延
40 ms
说话人相似度(Resemblyzer)
92.61 %
主观说话人相似度(S-MOS)
4.67

技术优势

参数缩减38倍

通过全因果镜像解码器和标量量化替代残差矢量量化,在保持语音质量的同时大幅降低复杂度。

时延仅40毫秒

语音适应在压缩域内以低时延完成,满足实时交互对响应速度的苛刻要求。

自带版权防护

系统本身防止未授权声音模仿,无需额外版权管理模块,降低商用部署的合规风险。

应用场景