零样本检测精度提升
针对零样本目标检测,将单提示短语定位分解为多步理解与检测流程,通过为每张图像生成特定提示来缓解幻觉与错误,在多个自然图像数据集上取得了优于现有方法的检测精度。
Miaotian, Guo · Kewei, Wu · 姜竹青 · 王海婴 · 门爱东
Knowledge-Based Systems 2025
通过把单一提示分解为多步理解并生成图像特定提示,模型不再试图用一个通用提示定位所有类别,从而减少了视觉-文本错配导致的错误检测。
针对每个场景动态生成量身定制的提示,而不是对所有图像使用同一套标签短语,使得文本条件更贴合图像内容,从而提升推理准确性。
在五个不同场景的公共自然图像数据集上进行了广泛实验,结果表明该方法在检测精度上超越了现有方案。