ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DeepKE知识图谱抽取实战指南:30分钟跑通实体识别与关系抽取

DeepKE知识图谱抽取实战指南:30分钟跑通实体识别与关系抽取 DeepKE知识图谱抽取实战指南30分钟跑通实体识别与关系抽取【免费下载链接】DeepKE[EMNLP 2022] An Open Toolkit for Knowledge Graph Extraction and Construction项目地址: https://gitcode.com/gh_mirrors/de/DeepKEDeepKE是一个开源的深度学习知识图谱抽取框架基于PyTorch实现命名实体识别、关系抽取与属性抽取能帮你把非结构化文本自动变成结构化知识。无论你是刚入门NLP的新手还是需要快速构建知识库的工程师这篇教程都将带你从零开始在30分钟内跑通一个完整的知识抽取项目。一个真实痛点非结构化文本中的知识为何总被浪费先问自己一个问题公司积累的合同、研究报告、新闻稿件、论文摘要……这些文本数据里的关键信息你靠什么提取人工逐条录入太慢。正则表达式硬匹配太脆换个句式就失效。于是大量高价值信息沉没在文档里迟迟无法进入你的业务系统。这正是知识图谱抽取要解决的问题把文本中的人名、地名、机构、事件以及它们之间的关系自动抽取为结构化三元组例如(马云, 创办, 阿里巴巴)。有了这些结构化的知识卡片检索、问答、推荐、风控等上层应用才有了可靠的数据底座。DeepKE 正是为此而生的开源工具。它把学术界验证过的优秀模型BERT、CNN、LSTM、W2NER、KnowPrompt 等工程化封装让你不用从零写模型代码也能用上顶会级的效果。更重要的是它默认支持中文场景对国内开发者极其友好。DeepKE 核心能力速览它能做哪些知识抽取任务在动手之前先用一张表看清 DeepKE 的能力版图。它围绕从文本到知识这条主线覆盖了四大核心任务并且为每个任务提供了从数据、模型到训练评估的完整闭环能力模块解决什么问题代表模型典型场景命名实体识别NER找出人名、地名、机构等实体BiLSTM-CRF、BERT、W2NER、LightNER新闻信息抽取、病历结构化关系抽取RE判断实体间的语义关系CNN、GCN、Transformer、KnowPrompt人物关系挖掘、产业链分析属性抽取AE提取实体的属性描述PCNN、Capsule、LM人物档案补全、商品信息整理事件抽取EE识别事件触发词与论元DEGREE、BERT-CRF舆情监控、金融事件预警此外DeepKE 还针对标准全监督、少样本低资源、文档级、多模态四类场景分别提供了解决方案——这意味着无论你的数据是很充足还是只有几百条都能找到合适的武器。DeepKE 为三大抽取任务设计了统一框架Data数据、Model模型、Core训练评估预测三层各司其职便于扩展与复用。一句话总结DeepKE 把文本→知识的整条流水线都给你备好了你要做的只是填数据、调参数。核心源码统一位于src/deepke/目录下按任务拆分为name_entity_re、relation_extraction、attribution_extraction、event_extraction等模块结构清晰方便阅读与二次开发。DeepKE 环境配置与安装三分钟搭好运行环境理解能力之后先解决怎么跑起来的问题。DeepKE 提供两种安装方式这里推荐源码安装兼容性最稳。官方也提供了 Docker 镜像方案见docker/目录适合想跳过环境折腾的同学。# 克隆仓库国内用户推荐 git clone --depth 1 https://gitcode.com/gh_mirrors/de/DeepKE # 用 conda 创建独立虚拟环境避免污染系统 Python conda create -n deepke python3.8 conda activate deepke # 安装依赖并完成本地开发安装 pip install -r requirements.txt python setup.py develop三个小提醒强烈建议在Linux环境下运行这是官方推荐配置如果你的 pip 版本高于 24.0直接用pip install deepke可能遇到依赖冲突此时源码安装更稳妥环境就绪后各个任务的运行入口都放在example/目录下按任务/场景分层组织找起来非常直观。命名实体识别与关系抽取实战三步跑通第一个项目环境搭好了下面以常规关系抽取为例走一遍数据→训练→预测的最小闭环。全程约 20 分钟你就能亲眼看到模型从文本中抽出结构化三元组。第1步准备数据看懂输入格式关系抽取的示例数据在example/re/standard/data/中支持json、csv、xlsx三种格式。训练前把文件放入data/origin/目录需要四份数据文件作用train.csv训练集包含句子及实体关系标注valid.csv验证集用于训练中评估test.csv测试集用于最终效果检验relation.csv全部关系类型清单如果不方便下载官方数据也可以参考data/下的example.*文件格式自行构造。非 CSV 格式的数据可用src/deepke/transform_data.py中的json2csv函数统一转换。数据标注工作则推荐配合开源的doccano工具完成——DeepKE 提供了完整的标注说明文档从创建项目、定义标签到逐条标注都有配图指引用 doccano 逐句标注实体与关系标注结果可直接转换为 DeepKE 的训练格式。第2步一键训练参数都给你留好了进入任务目录并启动训练cd DeepKE/example/re/standard # 训练参数都在 conf 目录下默认配置即可跑通 python run.py训练日志保存在logs/模型权重保存在checkpoints/想换模型conf/model/下已备好cnn、rnn、gcn、transformer、lm、capsule等 6 种配置改一行配置文件即可切换支持多卡训练在train.yaml中设置use_multi_gpuTrue并指定gpu_ids即可。第3步预测验证抽取效果训练完成后修改conf/predict.yaml中的模型路径为checkpoints里的.pth文件记得用绝对路径然后执行python predict.py模型会输出句子中实体对及其关系类别你就能直观看到知识被抽取出来的全过程。整个终端操作流程可以参考下面这段演示动图到此你已经完成了第一个 DeepKE 知识抽取项目。核心心法只有一句改配置文件而不是改源码。数据、模型、训练超参数全部通过 yaml 配置暴露让实验迭代变得非常轻量。进阶玩法少样本、多模态与大模型驱动的知识抽取跑通基础流程只是开始。如果你的数据或场景更复杂DeepKE 还准备了多套进阶武器进阶一少样本场景数据不足也能训练实际业务中标注数据往往稀缺。DeepKE 的 few-shot 方案example/re/few-shot/、example/ner/few-shot/针对低资源场景设计其中KnowPrompt通过将知识注入提示词在仅有几十条样本时也能保持不错的抽取效果还内置了中英文数据增强工具DA/帮你低成本扩充训练集。进阶二文档级与多模态抽取文档级关系抽取example/re/document/适用于多实体、跨句子建模的复杂文档代表模型 DocuNet多模态抽取example/ner/multimodal/、example/re/multimodal/同时利用文本与图片信息对图文并茂的社交媒体、电商页面等场景效果显著实体识别进阶W2NER 采用多粒度膨胀卷积是当前中文 NER 的强基线代码位于example/ner/standard/w2ner/。进阶三大模型时代用 LLM 做抽取DeepKE 团队还发布了DeepKE-LLMexample/llm/支持 ChatGLM、LLaMA、Qwen、GPT 等主流大模型覆盖 In-context Learning、指令微调等玩法以及基于 Chinese-Alpaca-2-13B 微调的OneKE大模型知识抽取框架中英双语开箱即用。如果你的算力充足、追求极限效果这条路值得探索。进阶四开箱即用的中文特别版不想训练直接下载DeepKE-cnSchema特别版预训练模型见README_CNSCHEMA_CN.md它基于 cnSchema 体系训练支持50 种关系类型和 28 种实体类型覆盖人物、地点、机构、出生地、国籍、朝代等常见类别加载即用特别适合快速验证业务想法。避坑指南知识抽取训练中常见的五个坑与解决办法结合社区反馈这五个问题出现频率最高提前了解能帮你省下大把时间依赖版本冲突⚠️ 最常见DeepKE 对torch、transformers、hydra-core等版本有严格要求版本漂移会导致各种诡异报错。对策严格按requirements.txt锁定版本并坚持用 conda 虚拟环境隔离。模型下载超时/失败预训练权重默认从 HuggingFace 拉取国内网络常不稳定。对策使用hf-mirror.com镜像下载到本地再修改conf/hydra/model/*.yaml中的模型路径指向本地文件。Windows 路径报错部分场景下 Windows 反斜杠路径会导致配置解析失败。对策路径中统一使用\\或直接换用 Linux 环境。wandb 初始化卡住训练脚本集成了 wandb 可视化无账号时可能阻塞启动。对策按提示登录或设置离线模式不影响训练本身。预测时模型加载失败常因predict.yaml中的权重路径写成了相对路径。对策务必使用.pth文件的绝对路径。遇到问题先查README_CN.md的常见问题章节再不行就提 Issue——这个项目的社区响应非常积极不用自己硬扛。总结与延伸学习从入门到部署的完整路线30 分钟你已经走完了安装 → 数据准备 → 训练 → 预测的完整链路掌握了 DeepKE 这个开源知识图谱抽取工具的核心用法。回顾一下这趟旅程选工具DeepKE 统一封装了 NER、RE、AE、EE 四大任务中文友好、模型丰富跑起来源码安装 配置文件驱动三步完成最小实战玩进阶少样本、多模态、文档级、大模型、开箱即用模型总有一款匹配你的场景。接下来你可以按这条路线继续深入学习目标对应资源查看完整文档与 API 参考docs/source/系统学习各任务示例example/含 ner、re、ae、ee、llm 等阅读源码与二次开发src/deepke/下载预训练模型pretrained/大模型抽取方案example/llm/含 OneKE、InstructKGC知识图谱的构建如今不再是算法专家才能触碰的领域。从今天开始用 DeepKE 把你的第一份文本数据变成结构化知识吧——先跑通一个最小项目再逐步叠加进阶能力你会发现知识抽取这件事比想象中简单得多。【免费下载链接】DeepKE[EMNLP 2022] An Open Toolkit for Knowledge Graph Extraction and Construction项目地址: https://gitcode.com/gh_mirrors/de/DeepKE创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表