oomol-lab/pdf-craft
PDF craft can convert PDF files into various other formats. This project will focus on processing PDF files of scanned books.
何を解決するか
pdf-craft は、スキャンされた PDF を含む PDF を、検索可能で編集可能な形式(Markdown や EPUB)に変換するための変換ライブラリです。特に、書籍、学術論文、技術文書をターゲットとしており、目次、脚注、表、数式、画像などの複雑な要素を処理します。
動作方法
このライブラリは、ページ画像をテキストに変換するための OCR(光学文字認識)パイプラインを使用しています。DeepSeek OCR や Baidu の無制限 OCR など、複数の OCR バックエンドをサポートしており、NVIDIA GPU(CUDA を介して)でローカル実行するか、リモートベンダーのサービスを経由して実行できます。翻訳には、別途のテキスト LLM を統合し、変換中にコンテンツを翻訳するか、既存の EPUB を翻訳できます。また、「PDF から PDF への翻訳」も可能で、翻訳されたテキストを元の PDF レイアウトに書き戻すことができます。
対象ユーザー
スキャンされた PDF からテキストを抽出する必要がある研究者、学生、開発者。さらに、他の言語に翻訳するための構造化・編集可能な形式に変換したい人。
特徴
- 柔軟な OCR バックエンド: ローカル GPU 実行とリモート API ベースの OCR の両方をサポート。
- マルチフォーマット出力: PDF を Markdown、EPUB、または翻訳された PDF に変換可能。
- LLM ベースの翻訳: 変換プロセス中にコンテンツを翻訳するためのテキスト LLM と統合。
- 複雑なドキュメント処理: 数式や表を含む学術的・技術的文書に特に最適化。
- EPUB 翻訳: 既存の EPUB ファイルを翻訳でき、元のテキストを置き換えるか、翻訳を追加するオプションあり。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト