Prompt2Act机器人操控框架

开放世界任务更可靠

用视觉定位与混合执行机制,把多模态提示稳定地变成机器人动作序列,应对开放世界里的多样操控任务。

Maowei, Jiang · Qi, Wang · Hongfeng, Ai · Zhiyong, Dong · Yusong, Hu · Ao, Liang · Yifan, Wang · Ruiqi, Li · Quangao, Liu · Moquan, Chen · Buš, Peter · 曾龙

Information Fusion 2026

技术优势

视觉定位更准

VG-Marker算法使用开放词汇感知模型(如SAM)增强VLMs的视觉定位能力,能更精确地识别场景中的视觉元素。

任务执行更灵活

混合执行代理(MEA)结合预定义技能与动态代码生成,能够根据任务需要灵活选择执行方式。

应用场景