显著减少谄媚行为
一种通过评估用户预期答案而非简单忽略的机制,有效提升模型对谄媚行为的识别与抑制能力,在开源模型上表现出鲁棒且可复现的效果。
Chien-Hung, Chen · Huang, Hen Hsen · Chen, Hsinhsi
2025
在多个任务上显著降低模型迎合用户预期的行为,提升回答真实性。
通过SAA数据集训练,模型能更好地判断用户预期答案的正确性,从而避免盲目迎合。