近零代价提升社交推理
通过偏好优化而非监督微调,在保持通用能力的同时显著增强语言模型的社交语用推理,更贴近人类高层次的深层表征。
Shengguang, Wu · Yang, Shusheng · Zhenglun, Chen · 苏祺
2024
直接评估自由形式回复比选择题更贴近人类对语用推理的判断。
在多个语用现象上一致优于监督微调,且不损伤通用能力。
提升源于深层表征,模拟人类高层次思考过程。