yfedoseev/pdf_oxide
The fastest PDF library for Python and Rust. Text extraction, image extraction, markdown conversion, PDF creation & editing. 0.8ms mean, 5× faster than industry leaders, 100% pass rate on 3,830 PDFs. MIT/Apache-2.0.
何を解決するか
PDFOxideは、既存のPDFライブラリの速度とライセンス制限を解決するために設計された、高性能なPDFツールキットです。PyMuPDFのようなライブラリに代わる、高速でMITライセンスの選択肢を提供し、20種類の異なるプログラミング言語にわたってPDFからの効率的なテキスト、画像、およびレイアウトの抽出を可能にします。
仕組み
このプロジェクトは、最大限のパフォーマンスと安定性を実現するためにRustで書かれたコアを使用しており、安定したC ABIを提供します。このコアは、他の19の言語(Python、Go、JS/TS、C#、Java、C++を含む)向けの慣習的なバインディングでラップされています。テキスト抽出、Markdown変換、画像抽出、およびPDF編集(フォームフィールドの入力など)を含む幅広い機能を提供します。
対象ユーザー
- AI/LLM開発者: LLMでの利用のためにPDFをクリーンなMarkdownに変換する必要があるRAG (Retrieval-Augmented Generation) パイプラインを構築している方。
- AIアシスタント: 提供されているMCPサーバーを介してローカルのPDFアクセスを希望する、Claude、Cursor、またはその他のMCP互換ツールを利用しているユーザー。
- エンタープライズ・ソフトウェアエンジニア: 大規模なドキュメント処理のために、信頼性が高く、寛容なライセンスのツールキットを必要とする開発者。
- 学術研究者: 大規模な学術論文のコーパスを解析している方。
ハイライト
- 極めて高い速度: ドキュメントあたり平均0.8msでベンチマークされており、PyMuPDFやpypdfよりも大幅に高速です。
- 幅広い言語サポート: Rust、Python、Go、WASMを含む20の言語向けのネイティブバインディング。
- 高い信頼性: 3,830個の実世界のPDFコーパスにおいて100%の合格率。
- AI対応: AIアシスタント向けの専用MCPサーバーと、RAGパイプライン用の組み込みMarkdown変換機能を搭載。
- 寛容なライセンス: MIT/Apache-2.0のデュアルライセンスにより、AGPLの制限を回避。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト