并行解码3D密集字幕模型

定位与描述解耦

该框架通过并行解码与特征解耦,避免传统级联流程中的误差累积,适合需要同时输出目标定位和自然语言描述的场景。

Sijin, Chen · Zhu, Hongyuan · Mingsheng, Li · 陈鑫 · Peng, Guo · 雷印杰 · Yu, Gang · 李太豪 · 陈涛

IEEE Transactions on Pattern Analysis and Machine Intelligence 2024

技术优势

误差不再累积

并行解码让定位和描述独立输出,不像级联流程那样前者错误影响后者。

定位描述各取所需

将查询解耦为定位查询和字幕查询,捕捉各自任务所需的场景特征,解决共享查询表达能力不足的问题。

收敛更快定位更准

迭代空间修正策略对查询投票,加快训练收敛同时提升定位精度。

描述更精准

在字幕头部加入额外空间信息,让生成的描述与物体空间位置更贴合。

应用场景