LLM-TIKG威胁情报知识图谱构建

少样本自动化构建

利用大语言模型解决了威胁情报实体领域属性和长文本分析的限制,并首次实现对攻击行为描述的TTP提取。

Yuelin, Hu · 邹福泰 · Jiajia, Han · Sun, Xin · Yilei, Wang

Computers and Security 2024

参数信息

命名实体识别精确率
87.88 %
TTP分类精确率
96.53 %

技术优势

少样本即可标注

利用GPT的少样本学习能力实现数据标注与增强,无需大量人工标注即可构建训练数据集。

小模型够用

微调后的7B小语言模型即可完成主题分类、实体关系提取与TTP抽取,降低部署门槛。

补全攻击行为

从攻击描述文本中提取TTP,弥补了以往忽略攻击行为文本描述的不足,保留理解复杂威胁的关键信息。

精度高

在构建的数据集上,命名实体识别精确率达到87.88%,TTP分类精确率达到96.53%。

应用场景