3D视频有声可及
专为360°全景视频设计的多模态框架,通过整合视觉与听觉信息生成细致的声音描述,显著提升听障人士的视频可访问性。
Wang, Yujia · Qingyun, Deng · 梁玮
IEEE Transactions on Circuits and Systems for Video Technology 2025
不仅识别声音类型,还能生成描述性文本,使听障用户理解声音内容。
同时利用视觉和听觉信息,从预训练大语言模型引导跨模态训练,提高理解准确性。
混合媒体界面允许用户分层可视化生成结果,并个性化定制声音描述生成。