生成可解释证据片段
该框架能够从索马里语文本中提取词级和短语级的证据片段,为自己的预测提供人类可理解的解释,从而提升内容审核的透明度和可信度。
Abdisalam Mahamed, Badel · 钟婷 · 徐增 · Tai, Wenxin · Zhou F.
Scientific Reports 2026
模型不仅输出攻击性判定,还定位到支撑判断的文本片段,让审核人员可以直接看到哪些词触发了预警。
在同一个数据集上,LIME 方法生成的解释质量较差,而该框架在 plausibility 和 faithfulness 两个指标上都更高,说明其解释与人类判断更一致。
该工作构建了 10,175 条带人工标注理由的索马里语攻击性语言数据集,填补了低资源语言可解释检测的资源空白。
评估的四个 LLM 中有一半无法生成与人类标注对齐的可靠理由,说明仅靠大模型做解释尚不成熟,专用框架仍具价值。