VEH视频背景音乐生成算法

和弦级数可控

用和弦进行序列对齐视觉语义,把音乐理论可解释因素引入可控视频配乐生成,效果优于现有方法。

Xinyi, Tong · Sitong, Chen · Peiyang, Yu · Nian, Liu · Qv, Hui · Ma, Tao · Zheng, Bo · Feng, Yu · 朱松纯

IEEE Transactions on Computational Social Systems 2024

技术优势

不要配对数据

视觉语言模型只靠类别标签和描述词就能把视频特征连到和弦进行,省掉了大规模人工标注的视频-音乐对。

乐理上可控

能量模型把和弦进行的好坏量化成统计量,可以当作生成时的可解释控制因子,符合音乐理论。

对齐得更好

实验证明生成的音乐和视频的匹配度超过现有最优方法。

应用场景