lumina-ai-inc/chunkr

Vision infrastructure to turn complex documents into RAG/LLM-ready data

解决的问题

Chunkr 是一个文档智能 API,旨在将 PDF、PowerPoint 演示文稿、Word 文档和图像等复杂文档转换为结构化、LLM 就绪的块。它通过处理布局分析、OCR 和语义分块,解决了为检索增强生成(RAG)管道准备高质量数据的问题。

工作原理

该项目提供了一个生产就绪的服务,通过布局分析、OCR(带边界框)和视觉语言模型(VLM)处理的流水线来处理文档。它将原始文件转换为结构化的 HTML 和 Markdown 格式,然后进行语义分块,以供 LLM 使用。开源版本使用社区和开源模型完成这些任务,而托管的云 API 版本则使用专有模型以实现更高的准确性。

适用人群

适用于需要自动化处理各种文件格式的文档解析和分块流程的开发者和 AI 工程师,构建 RAG 应用程序。

主要亮点

  • 多格式支持:支持处理 PDF、PPT、Word 文档和图像。
  • 结构化输出:生成 HTML 和 Markdown,便于 LLM 消费。
  • 布局分析:执行带边界框的布局分析和 OCR。
  • 灵活的 LLM 配置:通过 models.yaml 配置文件支持多种 LLM 提供商(OpenAI、Google AI Studio、OpenRouter,以及 vLLM 或 Ollama 等自托管选项)。
  • Docker 就绪:支持 GPU、仅 CPU 和 Mac ARM 架构,可通过 Docker Compose 轻松部署。

相关

  • 项目
  • 项目
  • 项目
  • 项目