VLAD视觉-语言对齐模型

小样本分布外更稳健

利用冻结的语言嵌入作为不变锚点,通过亲和力和发散原则抑制非因果特征,在小样本分布外场景下提供更紧的泛化误差上界。

Lin, Zhu · Weihan, Yin · Yiyao, Yang · Fan, Wu · Zhaoyu, Zeng · Qinying, Gu · 王新兵 · 周成虎 · Ye, Nanyang

International Journal of Computer Vision 2024

技术优势

抗分布偏移

冻结的语言嵌入作为不变锚点,使模型在输入分布变化时仍保持稳定的语义对齐,增强对OOD数据的泛化能力。

抑制虚假关联

发散原则促使模型忽略与任务无关的虚假特征,只依赖因果特征进行预测,从而在含有噪声或偏差的数据上仍能正确分类。

有理论保证

论文证明了所提出的正则化损失能给出更紧的OOD泛化误差上界,为方法的有效性提供了严格的理论支撑。

应用场景