yfedoseev/pdf_oxide

The fastest PDF library for Python and Rust. Text extraction, image extraction, markdown conversion, PDF creation & editing. 0.8ms mean, 5× faster than industry leaders, 100% pass rate on 3,830 PDFs. MIT/Apache-2.0.

何を解決するか

PDFOxideは、既存のPDFライブラリの速度とライセンス制限を解決するために設計された、高性能なPDFツールキットです。PyMuPDFのようなライブラリに代わる、高速でMITライセンスの選択肢を提供し、20種類の異なるプログラミング言語にわたってPDFからの効率的なテキスト、画像、およびレイアウトの抽出を可能にします。

仕組み

このプロジェクトは、最大限のパフォーマンスと安定性を実現するためにRustで書かれたコアを使用しており、安定したC ABIを提供します。このコアは、他の19の言語(Python、Go、JS/TS、C#、Java、C++を含む)向けの慣習的なバインディングでラップされています。テキスト抽出、Markdown変換、画像抽出、およびPDF編集(フォームフィールドの入力など)を含む幅広い機能を提供します。

対象ユーザー

  • AI/LLM開発者: LLMでの利用のためにPDFをクリーンなMarkdownに変換する必要があるRAG (Retrieval-Augmented Generation) パイプラインを構築している方。
  • AIアシスタント: 提供されているMCPサーバーを介してローカルのPDFアクセスを希望する、Claude、Cursor、またはその他のMCP互換ツールを利用しているユーザー。
  • エンタープライズ・ソフトウェアエンジニア: 大規模なドキュメント処理のために、信頼性が高く、寛容なライセンスのツールキットを必要とする開発者。
  • 学術研究者: 大規模な学術論文のコーパスを解析している方。

ハイライト

  • 極めて高い速度: ドキュメントあたり平均0.8msでベンチマークされており、PyMuPDFやpypdfよりも大幅に高速です。
  • 幅広い言語サポート: Rust、Python、Go、WASMを含む20の言語向けのネイティブバインディング。
  • 高い信頼性: 3,830個の実世界のPDFコーパスにおいて100%の合格率。
  • AI対応: AIアシスタント向けの専用MCPサーバーと、RAGパイプライン用の組み込みMarkdown変換機能を搭載。
  • 寛容なライセンス: MIT/Apache-2.0のデュアルライセンスにより、AGPLの制限を回避。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト