索马里语攻击性语言检测框架

生成可解释证据片段

该框架能够从索马里语文本中提取词级和短语级的证据片段,为自己的预测提供人类可理解的解释,从而提升内容审核的透明度和可信度。

Abdisalam Mahamed, Badel · 钟婷 · 徐增 · Tai, Wenxin · Zhou F.

Scientific Reports 2026

参数信息

数据集样本量
10,175
对比的微调模型数量
5
评估的 LLM 数量
4

技术优势

能指出具体词/短语

模型不仅输出攻击性判定,还定位到支撑判断的文本片段,让审核人员可以直接看到哪些词触发了预警。

解释比 LIME 更忠实

在同一个数据集上,LIME 方法生成的解释质量较差,而该框架在 plausibility 和 faithfulness 两个指标上都更高,说明其解释与人类判断更一致。

标注了 1 万条理由

该工作构建了 10,175 条带人工标注理由的索马里语攻击性语言数据集,填补了低资源语言可解释检测的资源空白。

暴露 LLM 解释短板

评估的四个 LLM 中有一半无法生成与人类标注对齐的可靠理由,说明仅靠大模型做解释尚不成熟,专用框架仍具价值。

应用场景