读视频文字,写专属描述
这是首个为视频场景文字描述任务设计、能动态整合画面文字并生成针对性描述的模型。
Tao, Jin · Wang, Lin · Hao, Jiang · Jian, Wang · Xiao, Jin · Zhimeng, Zhang · Chen, Jingyuan · 赵洲 · Zhongfei, Zhang
Expert Systems with Applications 2025
模型采用基于指针网络的生成器,动态感知视频中的场景文字,从而生成包含具体文字信息的描述。
通过层级对比机制在模态级和时间级施加约束,增强对场景文本信息的有效利用,使描述内容更具体。
场景交互编码器将每一帧与相关视频场景关联,聚类语义相关的帧和物体,从而提升描述质量。