和弦级数可控
用和弦进行序列对齐视觉语义,把音乐理论可解释因素引入可控视频配乐生成,效果优于现有方法。
Xinyi, Tong · Sitong, Chen · Peiyang, Yu · Nian, Liu · Qv, Hui · Ma, Tao · Zheng, Bo · Feng, Yu · 朱松纯
IEEE Transactions on Computational Social Systems 2024
视觉语言模型只靠类别标签和描述词就能把视频特征连到和弦进行,省掉了大规模人工标注的视频-音乐对。
能量模型把和弦进行的好坏量化成统计量,可以当作生成时的可解释控制因子,符合音乐理论。
实验证明生成的音乐和视频的匹配度超过现有最优方法。