触觉视觉实时融合
用状态空间模型替代传统Transformer,实现全局感受野和线性复杂度,可有效处理长程多模态依赖,并针对滑移检测任务专门设计了触觉-视觉编码器。
Shaohua, Zhang · Haoze, Li · 毛秉毅 · 赵逢达 · 陈雯柏 · 高国伟 · 吴培良
IEEE Robotics and Automation Letters 2025
状态空间模型将计算复杂度从Transformer的平方级降为线性,模型可实时处理长序列。
通过CLIP式预训练,触觉和视觉编码器与语言模型在特征空间中对齐,多模态信息融合更好。