oomol-lab/pdf-craft

PDF craft can convert PDF files into various other formats. This project will focus on processing PDF files of scanned books.

何を解決するか

pdf-craft は、スキャンされた PDF を含む PDF を、検索可能で編集可能な形式(Markdown や EPUB)に変換するための変換ライブラリです。特に、書籍、学術論文、技術文書をターゲットとしており、目次、脚注、表、数式、画像などの複雑な要素を処理します。

動作方法

このライブラリは、ページ画像をテキストに変換するための OCR(光学文字認識)パイプラインを使用しています。DeepSeek OCR や Baidu の無制限 OCR など、複数の OCR バックエンドをサポートしており、NVIDIA GPU(CUDA を介して)でローカル実行するか、リモートベンダーのサービスを経由して実行できます。翻訳には、別途のテキスト LLM を統合し、変換中にコンテンツを翻訳するか、既存の EPUB を翻訳できます。また、「PDF から PDF への翻訳」も可能で、翻訳されたテキストを元の PDF レイアウトに書き戻すことができます。

対象ユーザー

スキャンされた PDF からテキストを抽出する必要がある研究者、学生、開発者。さらに、他の言語に翻訳するための構造化・編集可能な形式に変換したい人。

特徴

  • 柔軟な OCR バックエンド: ローカル GPU 実行とリモート API ベースの OCR の両方をサポート。
  • マルチフォーマット出力: PDF を Markdown、EPUB、または翻訳された PDF に変換可能。
  • LLM ベースの翻訳: 変換プロセス中にコンテンツを翻訳するためのテキスト LLM と統合。
  • 複雑なドキュメント処理: 数式や表を含む学術的・技術的文書に特に最適化。
  • EPUB 翻訳: 既存の EPUB ファイルを翻訳でき、元のテキストを置き換えるか、翻訳を追加するオプションあり。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト