时空感知体素Transformer

多帧融合补全场景

通过多帧上下文感知和概率性深度融合,在相机输入下实现更完整、更准确的3D语义重建。

吴亦奇 · Changliang, Li · Jiale, He · Feng, Cao · 陈壹林 · 张德军

Neural Networks 2026

技术优势

时序帧对齐更稳

通过时空感知机制对齐多帧上下文特征,在视角变化下保持时间一致性,减少运动带来的错位。

深度估计更可靠

将单目深度先验与双目约束概率融合,提升深度估计准确性,从而指导体素重建更精确。

性能追平或超越

在SemanticKITTI和SSCBench-KITTI-360两个主流基准上均达到或超越当前最优方法,无需额外传感器。

应用场景