对抗学习三维问答模型

鲁棒性显著提升

首个针对三维视觉问答领域多样偏置的对抗学习框架,无需额外数据集即超越部分预训练模型。

Mao, Aihua · Shuyi, Wen · 陈峰 · 易冉 · 刘永进

IEEE Transactions on Circuits and Systems for Video Technology 2025

技术优势

首个对抗偏置框架

首次在3D-VQA领域引入对抗学习来消除语言模态和多个模块中的偏置,提高鲁棒性。

超越预训练模型

在EM@1和CIDEr指标上超越部分使用大规模额外数据集的预训练模型。

应用场景