时序定位对齐模型

零样本定位更准

通过双分支时序注意力,让视频定位模型在零样本下精确捕捉事件边界。

Yi, Liu · Haowen, Hou · Ma, Fei · 倪士光 · Yu, F. Richard

IEEE Signal Processing Letters 2024

技术优势

零样本直接可用

通过双分支生成互相一致的时间注意力,模型无需在目标数据集上微调即可精确捕捉事件边界,省去标注和训练成本。

描述式定位更准

利用MLLM的文本描述能力生成时间注意力,比仅输出一两个时间词的现有方法能更细致地建模视频时间结构,从而提升定位精度。

多任务适应强

模型在视频定位和高光检测两个任务、三个基准上均取得最优,证明其对不同下游任务具有良好的泛化能力。

应用场景