语言驱动抓取网络

开放词汇实例抓取

基于SAM的轻量级框架,让机器人听懂指令、抓对物品,只需少量参数微调即可在复杂场景中精准抓取。

Yunpeng, Mei · Jian, Sun · 彭志红 · 邓方 · 王钢 · 陈杰

IEEE Transactions on Multimedia 2025

参数信息

实例级准确率
91.2 %
实例级准确率
90.1 %
可训练参数占比
28.3 %

技术优势

听懂指令抓取

利用开放词汇提示定位物体并预测抓取位姿,无需为每个新物体类别重新训练,直接根据用户描述执行抓取。

微调成本很低

通过适配 SAM 的编码器适配器和多头解码器,仅训练 28.3% 的参数就能将分割能力迁移到抓取位姿估计,部署时算力负担小。

杂乱场景也能抓

在 GraspNet-1Billion 和 OCID 等杂乱多物体数据集上达到 90.1% 的实例级准确率,证明其能应对堆叠、遮挡等复杂环境。

应用场景