轻量神经语音编解码器
实时个性化语音通信
同时实现高质量语音压缩与低时延个性化语音转换,大幅降低模型复杂度,保障语音版权安全。
Xusheng, Yang · Wei, Xiao · Zixiang, Wang · Ge, Meng · Shang, Shidong · 邹月娴
Neural Networks 2026
参数信息
- 模型参数缩减
- 38 ×
- 语音质量(ViSQOL)
- 4.32
- 语音适应时延
- 40 ms
- 说话人相似度(Resemblyzer)
- 92.61 %
- 主观说话人相似度(S-MOS)
- 4.67
技术优势
参数缩减38倍
通过全因果镜像解码器和标量量化替代残差矢量量化,在保持语音质量的同时大幅降低复杂度。
时延仅40毫秒
语音适应在压缩域内以低时延完成,满足实时交互对响应速度的苛刻要求。
自带版权防护
系统本身防止未授权声音模仿,无需额外版权管理模块,降低商用部署的合规风险。
应用场景
- 实时音视频通信:以38分之一参数量提供同等音质,并支持40ms级个性化变声,直接融入现有通话链路。
- 低时延语音交互:40 ms语音适应满足对话式AI对即时反馈的严格时延要求。
- 边缘语音处理:38倍参数缩减使模型可部署于边缘设备,本地完成个性化语音处理。
- 语音助手:内置版权防护让助手可使用授权音色,防止声音克隆滥用。