TinyVLA视觉语言动作模型

免预训练,推理提速

用高速多模态骨干初始化策略,并在微调时引入扩散策略解码器,使机器人无需大规模预训练即可快速学习操作技能。

74739512 · Zhu, Yichen · 74739511 · 74739510 · Zhibin, Tang · Wu, Kun · Xu, Zhiyuan · 刘宁 · Ran, Cheng · 沈超敏 · 彭亚新 · Feifei, Feng · Tang, Jian

IEEE Robotics and Automation Letters 2025

参数信息

推理加速比
2.7 ×

技术优势

推理快2.7倍

相比OpenVLA,TinyVLA的推理速度提升2.7倍,使机器人能够更快速地响应指令并执行操作,适合实时控制场景。

无需预训练

TinyVLA消除了预训练阶段,直接利用高速多模态模型初始化策略骨干,大幅降低了对大规模机器人数据的需求,使快速适应新任务成为可能。

跨场景泛化

TinyVLA对语言指令、新物体、未见位置、物体外观变化、背景变化和环境变化均表现出强泛化能力,性能与OpenVLA相当或更优。

应用场景