Mid-Side令牌化双耳音频生成模型

空间线索更清晰

用Mid-Side令牌化把内容和空间信息显式拆开,大语言模型管语义,流匹配模块管耳间细节,生成的定位一致性和感知质量都超过了现有基线。

Changjun, He · Zhou, Lianyu · 张文杰 · Shiyun, Xu · 陈伟平 · 王明江

Neurocomputing 2026

技术优势

空间线索更清晰

通过侧感知门控流匹配模块聚焦耳间差异显著的片段,细化声学和空间细节,从而生成定位更一致的双耳音频。

内容与空间解耦

提出的 M–S 令牌化将双耳音频映射为高度压缩的离散令牌,其中 mid 令牌主要编码音频内容,side 令牌强调耳间差异,使后续建模更聚焦。

大模型做骨干

采用 Qwen2.5 解码器式 LLM 以自回归方式对文本条件化的 mid-side 令牌联合分布建模,擅长长期语义和粗略空间结构。

应用场景