价值观高维表征 UniVaR

跨模型可比

一个自监督的高维神经表征,可跨模型、跨语言量化并可视化大模型内部的人类价值观分布。

Cahyawijaya, Samuel · 陈德龙 · Bang, Yejin · Leila, Khalatbari · Wilie, Bryan · Ji, Ziwei · Ishii, Etsuko · Fung, Pascale

2025

参数信息

评估模型数
15
训练模型数
8
覆盖语言数
25

技术优势

无需标注数据

UniVaR 通过自监督方式从LLM输出中学习,不需要人工标注价值观样例,大幅降低构建成本。

跨模型通用

表征与模型架构和训练数据正交,可应用于任意LLM,便于统一审计和比较。

支持多语言分析

已在25种语言和文化的LLM输出上验证,可揭示跨语言价值观分布差异。

应用场景