yfedoseev/pdf_oxide
The fastest PDF library for Python and Rust. Text extraction, image extraction, markdown conversion, PDF creation & editing. 0.8ms mean, 5× faster than industry leaders, 100% pass rate on 3,830 PDFs. MIT/Apache-2.0.
它解决了什么问题
PDFOxide 是一个高性能的 PDF 工具包,旨在解决现有 PDF 库在速度和许可方面的限制。它提供了一个快速且采用 MIT 许可证的替代方案,可替代 PyMuPDF 等库,支持在 20 种不同编程语言中高效地从 PDF 中提取文本、图像和布局信息。
它如何工作
该项目的核心使用 Rust 编写,以实现最佳性能和稳定性,并提供稳定的 C ABI。该核心随后被封装为 19 种其他语言的惯用绑定(包括 Python、Go、JS/TS、C#、Java 和 C++)。它支持多种功能,包括文本提取、Markdown 转换、图像提取以及 PDF 编辑(例如填写表单字段)。
适合谁使用
- AI/LLM 开发者:正在构建 RAG(检索增强生成)流程,需要将 PDF 转换为干净的 Markdown 以供 LLM 使用的开发者。
- AI 助手用户:使用 Claude、Cursor 或其他兼容 MCP 的工具,希望通过提供的 MCP 服务器实现本地 PDF 访问的用户。
- 企业级软件工程师:需要一个可靠且许可宽松的工具包,用于大规模文档处理的开发者。
- 学术研究人员:需要解析大量学术论文语料库的研究人员。
主要亮点
- 极致速度:经基准测试,每份文档平均耗时 0.8ms,显著快于 PyMuPDF 和 pypdf。
- 广泛的语言支持:支持 20 种语言的原生绑定,包括 Rust、Python、Go 和 WASM。
- 高可靠性:在 3,830 个真实世界 PDF 的语料库上实现了 100% 的通过率。
- 面向 AI:包含专用的 MCP 服务器,适用于 AI 助手,并为 RAG 流程内置了 Markdown 转换功能。
- 宽松许可:采用 MIT/Apache-2.0 双许可,避免 AGPL 的限制。
一个真正快速且可靠的 PDF 工具包,适用于 AI 和大规模文档处理 — @username
相关
- 项目
- 项目
- 项目
- 项目
- 项目