magicrew/doc7

Turn documents into AI-ready Markdown with visual understanding

解决的问题

doc7 是一个文档转换工具,可将复杂的文档(包括 PDF、Office 文件、扫描件、截图、图表和示意图)转换为 AI 友好的 Markdown。它解决了传统 OCR 或文本提取过程中结构化和视觉信息(如公式、表格和图表关系)丢失的问题,使文档对 AI 模型更易于搜索和推理。

工作原理

doc7 不依赖传统的 OCR 堆栈或特定文件格式的解析器,而是采用全页视觉理解的方法。它将文档页面渲染为图像,并通过 OpenAI 兼容的多模态(视觉)模型进行处理。这使得工具能够重建页面内容,包括视觉元素,并以 Markdown 格式输出。用户可以通过 LM Studio 或 Ollama 在本地运行这些模型,以保护隐私并消除按页计费的 API 成本。

适用人群

  • AI 开发者:构建 RAG 流水线,需要从多种文档格式中获取高质量、结构化 Markdown 的开发者。
  • 注重隐私的用户:希望使用本地视觉模型处理文档,避免将数据发送到云端 API 的个人或组织。
  • 自托管用户:希望消除云服务提供商持续文档解析费用的用户。

核心亮点

  • 多模态流水线:对所有格式(PDF、Office、图像)使用单一视觉理解流水线,无需单独的 OCR/布局模型。
  • 本地模型支持:兼容任何 OpenAI 兼容的多模态模型,包括通过 Ollama 或 LM Studio 部署的本地模型。
  • 零边际成本:使用本地硬件时,无需支付每页费用或文档积分。
  • 强大的恢复能力:支持失败页面的恢复和使用不同模型重新处理特定页面。
  • 多功能接口:提供跨平台 CLI、Go SDK、MCP 工具以及异步 HTTP 服务。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目