时序更准
端到端框架利用语言模型的语义理解能力,同步生成声音事件及其时间位置,突破了纯音频特征分类的局限。
Hualei, Wang · Jianguo, Mao · Zhifang, Guo · Jiarui, Wan · 刘宏 · 王向东
2024
模型同时生成事件类别和时间位置,无需分离的定位后处理步骤,简化了系统流程。
语言模型能灵活理解与声学表示对齐的丰富语义上下文,弥补纯音频特征在分类上的不足。
实验表明所提方法能更准确地定位声音事件的时间边界,适用于对时序要求高的场景。
与纯声学方法相比,该方法在事件分类上表现更好,说明语义信息有助于区分相似声音。