动态关系图生成更准
借助跨模态文本嵌入差异作为监督,这个Transformer能够显式建模视频帧间关系随时间的演化,从而生成更贴合的动态场景图。
Jingyi, Wang · Huang, Jinfa · Zhang, Can · 邓志东
2023
利用跨模态文本嵌入差异作为监督信号,显式引导时变关系的学习。
TR2在Action Genome数据集上,两种设置下分别比现有最优方法提升2.1%和2.6%。