跨模型可比
一个自监督的高维神经表征,可跨模型、跨语言量化并可视化大模型内部的人类价值观分布。
Cahyawijaya, Samuel · 陈德龙 · Bang, Yejin · Leila, Khalatbari · Wilie, Bryan · Ji, Ziwei · Ishii, Etsuko · Fung, Pascale
2025
UniVaR 通过自监督方式从LLM输出中学习,不需要人工标注价值观样例,大幅降低构建成本。
表征与模型架构和训练数据正交,可应用于任意LLM,便于统一审计和比较。
已在25种语言和文化的LLM输出上验证,可揭示跨语言价值观分布差异。