docling-project/docling

Get your documents ready for gen AI

解决的问题

Docling 简化了将多种复杂文档格式转换为适合生成式 AI 应用的结构化、机器可读格式的过程。它解决了 LLM 通常难以直接处理的高级 PDF 布局、表格以及多模态内容(如图像和音频)的解析难题。

工作原理

Docling 使用一种称为 DoclingDocument 的统一文档表示格式,解析多种文件类型——包括 PDF、Office 文档、HTML,甚至视频/音频文件——并将其导出为 Markdown 或 JSON 等格式。它利用 OCR 处理扫描文档,使用视觉语言模型(VLM)理解复杂布局,使用自动语音识别(ASR)处理音频/视频字幕。

适用人群

专为构建 AI 代理、RAG(检索增强生成)管道和文档处理工作流的开发者设计,适用于需要将非结构化文档转换为干净结构化数据的场景。

主要亮点

  • 多模态解析:支持广泛的格式,包括 PDF、DOCX、PPTX、XLSX、HTML、EPUB、邮件格式,以及视频/音频文件。
  • 高级 PDF 理解:可处理页面布局、阅读顺序、表格结构和公式。
  • AI 生态系统集成:原生支持 LangChain、LlamaIndex、Crew AI 和 Haystack。
  • 本地运行:可在本地运行,适用于敏感数据和离线环境(空气隔离)。
  • 图表理解:将柱状图、饼图、折线图等转换为表格或代码,并附带详细描述。
  • 灵活导出:支持导出为 Markdown、HTML、JSON,以及 USPTO 和 JATS 等特定 XML 模式。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目