提速降内存
基于参数冻结与自适应特征选择,在保持跟踪精度的同时显著降低多模态交互的计算开销,适合在资源受限设备上实时部署。
刘立强 · Lingling, Yang · 黄烽 · 傅妍芳 · 冯甜甜 · 王舒 · Xie, Anyuan · 曹子建
Pattern Recognition 2026
自适应patch选择将视觉编码器注意力复杂度从二次方降为线性,显著减少计算量,推理时间从37.8ms降至26.8ms。
通过减少冗余跨模态交互并选择重要patch,模型显存占用大幅降低,有利于边缘设备部署。
分层动态参数冻结保持底层通用特征,只微调高层语义,减少语言先验对视觉定位的干扰。