overcuriousity/pdf2epub
Convert PDF files to nicely structured Markdown and EPUB format with intelligent layout detection using AI.
何を解決するか
PDFは、元々構造を持たないため、EPUBや構造化されたMarkdownなどの再フォーマットに変換するのが難しい場合があります。このツールは、特に書籍や学術論文を対象として、PDFファイルを整然としたMarkdownおよびEPUB形式に変換します。
動作方法
このプロジェクトは、AI駆動のレイアウト検出とテキスト抽出を組み合わせています。コアのPDF処理には marker-pdf を、テキスト処理には transformers を、GPU加速には PyTorch を使用しています(NVIDIA、AMD、Apple Siliconをサポート)。テーブルの検出、画像の抽出、文書構造の保持により、クリーンなMarkdown出力を生成し、カスタマイズ可能なスタイルでEPUBファイルに変換します。
対象ユーザー
学術論文や書籍をPDFから、電子書籍リーダー向けやMarkdownでのさらなる処理に適した、より読みやすく再フォーマット可能な形式に変換したい研究者、学生、電子書籍所有者。
特徴
- スマートなレイアウト検出:書籍および学術論文に特に最適化されています。
- GPU加速:NVIDIA(CUDA)、AMD(ROCm)、Apple Silicon(MPS)をサポートし、処理速度を向上します。
- OCRおよびテーブル処理:高度なテキスト抽出、OCR機能、テーブルフォーマットを備えています。
- マルチフォーマット出力:構造化されたMarkdownとEPUBファイルの両方を生成し、抽出された画像も含みます。
- 多言語対応:複数言語のドキュメントを処理可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト