负样本促安全生成
首个利用负面示例的对比迭代训练损失,在安全生成、矛盾避免和开放域对话三个任务上均超越强基线,且实现简单、易于训练。
Leonard, Adolphs · Gao, Tianyu · Jing, Xu · Shuster, Kurt · Sukhbaatar, Sainbayar · Weston, Jason
2023
通过对比迭代生成负样本,让模型学习避免不想要的输出。
概念简单,易于训练和集成到现有流程。