鲁棒性显著提升
首个针对三维视觉问答领域多样偏置的对抗学习框架,无需额外数据集即超越部分预训练模型。
Mao, Aihua · Shuyi, Wen · 陈峰 · 易冉 · 刘永进
IEEE Transactions on Circuits and Systems for Video Technology 2025
首次在3D-VQA领域引入对抗学习来消除语言模态和多个模块中的偏置,提高鲁棒性。
在EM@1和CIDEr指标上超越部分使用大规模额外数据集的预训练模型。