低语义模板可跟踪
以生成式多模态融合重建模糊模板的语义,弥合图文特征鸿沟。
Xingyu, Luo · Yidong, Cai · Jie, Liu · Tang, Jie · 武港山 · 王利民
International Journal of Computer Vision 2026
对语义模糊的模板图像做生成式重建,补全丢失的视觉线索后再与文本融合,提升跨模态特征质量。
用扩散模型做生成式多模态融合,而不是简单拼接,从而增强文本与图像的兼容性,提升模板语义信息。
在多个基准测试上建立了新的最先进性能,验证了生成式融合范式的优势。
在达到最优精度的同时保持令人印象深刻的推理速度,满足实际部署需求。