图神经算子
跨模态对齐
统一架构中实现结构保持、关系对齐和语义对应。
张百灵
Pattern Recognition 2026
参数信息
- F1分数
- 0.5662
- 训练样本数
- 500–5000
- 稀疏标签提升
- 180 fold
技术优势
稀疏标签也能训
加权损失函数在稀疏对齐标签上带来180倍提升,大幅降低标注需求。
几百样本就够
仅用500–5000个训练样本即可取得有竞争力的F1=0.5662,无需大规模数据。
结构不丢
将视觉和文本图视为函数进行映射,显式保持细粒度结构关系,避免全局嵌入的信息损失。
应用场景
- 多模态对齐:为跨模态数据建立实体级对应关系,替代依赖全局嵌入的粗粒度对齐。
- 图表示学习:将图结构映射为函数表示,在学习过程中显式保持细粒度结构。
- 跨模态检索:在Flickr30K上获得精确对齐分数,可直接用于图文互检索任务。
- 视觉问答:提供可解释的实体级对应,帮助VQA模型定位问题相关的视觉实体。