多模态食品风味识别模型

图像文本融合识别

通过跨注意力融合图像与文本特征,为食品内在风味的自动识别提供了一种不同于传统推荐系统的新途径。

Zhao, Su · Jun, Shen · 周庆国 · 雍宾宾

IEEE Transactions on Consumer Electronics 2024

技术优势

跨模态融合

通过跨注意力机制对齐图像与文本特征,使模型能同时利用视觉外观与配料信息来推断风味,比仅用单一模态更准确。

面向端侧部署

模型设计为接收用户拍摄的食物图像和输入的配料信息,在服务器或移动端推理,无需专业设备。

无需用户行为数据

直接从食物本身推断风味,不依赖推荐系统中常见的用户历史行为数据,保护隐私且适用于冷启动场景。

应用场景