分布偏移下稳健
在网络内部嵌入自洽机制,对同一图像生成多个答案进行交叉推理,使视觉问答在面对训练与测试分布差异时保持一致的输出。
Quanxing, Xu · 周岭 · 钟忺 · 张飞飞 · Tian, Jinyu · Yu, Xiaohan · Huang, Rubing
Pattern Recognition 2026
自洽机制鼓励模型为同一图像生成多个答案,细化跨问题推理,从而在大规模预训练模型上加强稳定性,而现有的视觉问答方法在分布偏移下退化明显。
利用合成数据训练的甄选函数判断预测是否可信,弥补了大多数以可靠性为导向的方法仅关注数据划分而不做数据增强的不足。