字幕更多样拟人
通过模态内与模态间双重正则约束,在统一训练目标下显著提升图像字幕的多样性与语义准确性。
Liya, Wang · 陈海鹏 · Yu, Liu · Lyu, Yingda
IEEE Transactions on Circuits and Systems for Video Technology 2024
通过模态融合推理分支和新的训练目标,挖掘图像与文本间的细粒度关系,生成的字幕在语义感知和关系推理上更接近人类。
在MS COCO 2014数据集及相同实验条件下,METEOR、ROUGE-L、CIDEr、SPICE指标均优于现有方法,说明生成的描述更准确、参考价值更高。
通过在模态内和模态间施加正则约束,并结合新的训练损失,避免模型陷入单一模式,增强生成字幕的多样性和新颖性。