yfedoseev/pdf_oxide
The fastest PDF library for Python and Rust. Text extraction, image extraction, markdown conversion, PDF creation & editing. 0.8ms mean, 5× faster than industry leaders, 100% pass rate on 3,830 PDFs. MIT/Apache-2.0.
解決する課題
PDFOxideは、既存のライブラリの速度とライセンス制限を克服するために設計された高性能PDFツールキットです。PyMuPDFなどのツールに代わる高速なMITライセンスの選択肢を提供し、20種類のプログラミング言語でPDFからの効率的なテキスト、画像、レイアウト抽出を可能にします。
仕組み
このプロジェクトは、PDF処理の重い作業を担うRustコアで構築されています。幅広いアクセシビリティを提供するために、安定したC ABIを公開しており、これにより他の19言語(Python、Go、JS/TS、Java、C++を含む)に対して慣習的なバインディングを作成できます。また、ターミナルベースの処理用のCLIツールや、ClaudeやCursorのようなAIアシスタントがローカルでPDFと対話できるようにするMCPサーバーも含まれています。
対象ユーザー
- RAGおよびLLM開発者: 検索拡張生成(RAG)パイプラインのために、PDFをクリーンなMarkdownに変換する必要がある方。
- AIアシスタント開発者: エージェントにローカルのPDFアクセスを統合したい方。
- データエンジニア: 学術研究や、フォーム・表からの構造化データ抽出のために、数千のPDFを大規模に処理する方。
- ソフトウェア開発者: 寛容なMITライセンスを持つPyMuPDFの代替案を探している方。
ハイライト
- 圧倒的なスピード: ドキュメントあたりの平均処理時間は0.8msで、PyMuPDFより5倍、pypdfより15倍高速であるとされています。
- 幅広い言語サポート: Rust、Python、Go、JS/TS、C#、Java、Kotlin、Swift、C++など、20言語のネイティブバインディングを提供。
- 高い信頼性: 3,830個の実世界のPDFコーパス(veraPDF、Mozilla pdf.js、DARPA SafeDocs)において100%の合格率を達成。
- AI対応: AIアシスタントとの直接的な統合のためのMCPサーバーを内蔵。
- 包括的な機能セット: テキスト、画像、レイアウトの抽出に加え、PDFの作成、編集、フォーム入力に対応。