计算量降四成
针对复杂活动识别场景,通过语义重要性指导剪枝并结合时空冗余合并,在保持精度的前提下大幅降低视频Transformer的计算开销。
Yumeng, Su · 张嘉超 · Yan, Rui · 李朋鹏 · Xie, Guosen · 舒祥波
IEEE Transactions on Circuits and Systems for Video Technology 2024
通过学习多个类标记捕捉类别特定的注意力分数,STPM能保留与活动类别最相关的标记,避免误删关键信息。
利用锚图和时序注意力做空间与时间上的标记合并,在消除语义重复和冗余的同时保留外观和时序线索。
在JRDB-PAR数据集上,相比基准方法,STPM在取得相近精度的同时所需计算量减少40%。