语言与框统一建模
将视觉语言跟踪表示为序列标记生成任务,端到端直接预测目标位置,无需复杂先验模块。
Yaozong, Zheng · 钟必能 · Liang, Qihua · 李国荣 · 纪荣嵘 · 李先贤
IEEE Transactions on Circuits and Systems for Video Technology 2023
将跟踪任务定义为序列生成,避免了多个子任务学习和手工设计损失函数,只用交叉熵损失统一优化。
在四个公开基准上取得与现有最优方法相当的结果,证明了统一范式的有效性。