视听大模型声音描述

3D视频有声可及

专为360°全景视频设计的多模态框架,通过整合视觉与听觉信息生成细致的声音描述,显著提升听障人士的视频可访问性。

Wang, Yujia · Qingyun, Deng · 梁玮

IEEE Transactions on Circuits and Systems for Video Technology 2025

参数信息

听障参与者数量
12
360°视频数量
24

技术优势

生成细致描述

不仅识别声音类型,还能生成描述性文本,使听障用户理解声音内容。

多模态融合

同时利用视觉和听觉信息,从预训练大语言模型引导跨模态训练,提高理解准确性。

交互式界面

混合媒体界面允许用户分层可视化生成结果,并个性化定制声音描述生成。

应用场景