声音事件检测框架

时序更准

端到端框架利用语言模型的语义理解能力,同步生成声音事件及其时间位置,突破了纯音频特征分类的局限。

Hualei, Wang · Jianguo, Mao · Zhifang, Guo · Jiarui, Wan · 刘宏 · 王向东

2024

技术优势

端到端联合生成

模型同时生成事件类别和时间位置,无需分离的定位后处理步骤,简化了系统流程。

利用语义理解

语言模型能灵活理解与声学表示对齐的丰富语义上下文,弥补纯音频特征在分类上的不足。

提升时间戳精度

实验表明所提方法能更准确地定位声音事件的时间边界,适用于对时序要求高的场景。

提升分类性能

与纯声学方法相比,该方法在事件分类上表现更好,说明语义信息有助于区分相似声音。

应用场景