媲美全参微调
一个即插即用的适配器,让冻结的视觉语言模型获得时序推理能力,在视频问答上以极低参数量达到全参微调水平。
Yuanyuan, Wang · 刘猛 · 宋雪萌 · 聂礼强
IEEE Transactions on Multimedia 2024
在四个视频问答数据集上达到甚至超过全参微调的性能。
仅需训练极少量参数,大幅降低存储与训练成本。
无需修改预训练模型,直接插入适配器模块即可赋予时序推理能力。