视觉-语言模型抓取框架

抓取准确率提升

该框架融合视觉、文本与人类先验知识,实现上下文感知的精准抓取,超越现有最先进方法。

Zhao, Zhou · Dongyuan, Zheng · 73189817 · 罗晶 · Yanjun, Wang · 黄攀峰 · Yang, Chenguang

IEEE Transactions on Automation Science and Engineering 2025

参数信息

抓取准确率提升 (Top-1, OCID-VLG)
9.91 %
抓取准确率提升 (Top-5, OCID-VLG)
5.70 %
抓取准确率提升 (Top-1, Grasp-MultiObject)
17.63 %
抓取准确率提升 (Top-5, Grasp-MultiObject)
22.76 %

技术优势

融合多模态,识别更准

同时使用视觉、文本和人类先验知识,在复杂动态环境中更准确地识别和操作物体。

上下文感知抓取

利用语言线索细化物体视觉表示,实现更符合场景的抓取动作。

准确率显著提升

在两个数据集上均大幅超越现有方法,最高提升22.76%。

应用场景