任意图像数生成连贯叙事
自回归视觉叙事模型,面向任意长度的图像序列,能生成视觉可验证、连贯且无冗余的生动故事。
Lixin, Liu · 江爱文 · Yinuo, Chen · 刘长红 · 黄庆 · 王明文
ACM Transactions on Asian and Low-Resource Language Information Processing 2025
模型以开放式方式应用于不同长度的图像序列,无需固定图像数量。
借助大语言模型构建的 VIST++ 数据集提供了更丰富的叙事,模型在该数据上训练可生成更生动的故事。
在视觉基础、连贯性和非冗余性评估中,ReStoryGen 均取得令人印象深刻的成果。