视频文本定位网络

端到端免匹配

用文本查询在长时序中隐式跟踪并识别文本,摆脱了传统逐帧匹配的复杂后处理。

Wu, Weijia · Cai, Yuanqiang · Shen, Chunhua · Debing, Zhang · 付莹 · 周泓 · Ping, Luo

International Journal of Computer Vision 2024

参数信息

性能提升
11.0 %

技术优势

免去匹配和后处理

用文本查询在超过7帧的长时序上隐式跟踪和识别,不必在相邻帧间显式匹配。

端到端同时做三件事

同时解决检测、跟踪、识别三个子任务,整体训练,简化了系统设计。

四个数据集上刷新纪录

在 ICDAR2013 Video、ICDAR2015 Video 等四个数据集上取得最高 11.0% 的提升。

应用场景