面向中文民政政策文本的知识图谱数据集
简介
本项目提出了一种面向中文民政政策文本的知识图谱数据集构建框架。针对社会救助场景设计了一个领域本体,定义了12类概念和16种关系,用于描述民政政策的核心语义结构。 真实政策文件来源于民政部、全国人民代表大会及地方政府的官方网站。同时,采用了一种大规模结构化标注方法,该方法以有限的手动标注为基础,并借助大语言模型进行辅助。通过少量提示、模式约束和后处理机制,实现了高效的批量标注。
本体设计
以 .owl 格式的本体文件存储在 Ontology 文件夹中。需要使用 Protege 软件来打开和查看这些文件。
数据来源
原始文本数据存放在原始数据文件夹中,并按文档类型分为四个子文件夹:
- 规章制度:54份文件
- 法律法规:33份文件
- 规范性文件:274份文件
- 其他文件:536份文件
数据标注
手动注释
所有手动标注的文件均存储在“手动标注数据”文件夹中,共包含97个.json文件。标注工作使用Jingling标注工具完成。
基于LLM的标注
注释功能基于DeepSeek模型实现,核心脚本annotate.py集成了提示语、少量样本以及JSON格式转换逻辑。共有764个已标注的.json文件,存储在LLM标注数据文件夹中。
可视化工具
提供两个文件用于查看注释结果:
- index_annotated.html:前端可视化页面
- server_annotated.py:后端服务脚本
该资源暂时没有视图
其他信息
| 域 | 价值 |
|---|---|
| Data last updated | 2026年7月11日 |
| Metadata last updated | 2026年7月11日 |
| 创建的 | 2026年7月11日 |
| 格式 | JSON |
| 授权 | Open Data Commons Public Domain Dedication and License (PDDL) |
| Datastore active | False |
| Has views | False |
| Id | 8ae5cfe5-bdf2-4835-a541-332f1efad8fa |
| Package id | 426d37b2-a13f-4f79-9b7e-9f1f455fc416 |
| Position | 0 |
| State | active |