docling-project/docling-graph

Transform unstructured documents into validated, rich and queryable knowledge graphs.

解决的问题

Docling Graph 解决了从复杂文档(PDF、图像、Office 文件)中提取结构化、高精度数据,并将其转换为有向知识图谱的问题。与依赖近似文本嵌入的标准 RAG 系统不同,该工具确保实体之间的精确语义关系——例如化学物质与反应、金融工具及其依赖关系——使其在化学、金融和法律等专业领域至关重要。

工作原理

该系统使用配置驱动的流水线,将文档转换为经过验证的 Pydantic 对象,再进一步转换为 NetworkX 有向图。支持两种主要提取路径:通过 Docling 实现的本地 VLM(视觉语言模型)提取,或通过 LiteLLM 路由的基于 LLM 的提取(支持 OpenAI、Gemini 和 vLLM 等提供商)。用户使用 Pydantic 模板定义提取模式,这些模板可手动编写,也可从示例文档中推导,或从现有本体(OWL/RDFS)编译而来。

适用人群

专为在高精度领域(法律、金融、化学研究)工作的开发人员和数据科学家设计,他们需要将非结构化文档转化为具有严格验证和数据溯源的机器可读知识图谱。

主要亮点

  • 模板生成:可从示例文档自动推导 Pydantic 模板,或从正式本体编译而成。
  • 数据溯源:提供确定性的溯源日志,包含边界框几何信息,精确追踪数据提取来源。
  • 灵活后端:支持 VLM 和 LLM 提取,兼容本地运行时(Ollama、vLLM)和远程 API。
  • 图谱融合:可在无需额外 LLM 调用的情况下,将多个知识图谱合并为一个可审计、确定性的单一图谱。
  • 广泛格式支持:通过 Docling 集成,支持 PDF、图像、Markdown 和 Office 文件。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目