多模态滑移检测模型

触觉视觉实时融合

用状态空间模型替代传统Transformer,实现全局感受野和线性复杂度,可有效处理长程多模态依赖,并针对滑移检测任务专门设计了触觉-视觉编码器。

Shaohua, Zhang · Haoze, Li · 毛秉毅 · 赵逢达 · 陈雯柏 · 高国伟 · 吴培良

IEEE Robotics and Automation Letters 2025

技术优势

推理更快

状态空间模型将计算复杂度从Transformer的平方级降为线性,模型可实时处理长序列。

对齐更准

通过CLIP式预训练,触觉和视觉编码器与语言模型在特征空间中对齐,多模态信息融合更好。

应用场景