ispras/dedoc
Dedoc is a library (service) for automate documents parsing and bringing to a uniform format. It automatically extracts content, logical structure, tables, and meta information from textual electronic documents. (Parse document; Document content extraction; Logical structure extraction; PDF parser; Scanned document parser; DOCX parser; HTML parser
何を解決するか
Dedoc は、さまざまなドキュメント形式を統一された出力形式に変換するユニバーサルシステムです。Officeドキュメント、PDF、画像、HTMLを含む、半構造的・非構造的なデータから論理構造(見出しやリストなど)とコンテンツ(表、テキストフォーマット、メタデータなど)を抽出する問題を解決します。
動作方法
Dedoc は、専用のライブラリと機械学習技術の組み合わせを使用して、異なるファイル形式を処理します:
- Office および Web 形式:
python-docxおよびBeautifulSoupなどのライブラリを使用して、DOCX、XLSX、HTML の内部表現を分析します。 - PDF: コピーアウト可能な PDF には
pdfminer-sixを使用し、グラフィック印刷用にカスタムインタプリタを用いてフォーマットを抽出します。 - スキャン済みドキュメント: Tesseract OCR と OpenCV を使用して画像前処理を行い、機械学習モデルでドキュメントの向き、カラムレイアウト、太字テキストを検出します。
- 構造抽出: 入力形式にかかわらず、ドキュメントの階層的ツリー構造を自動的に決定します。
対象ユーザー
自動ドキュメント分析パイプライン、情報分析システム、自然言語処理(NLP)システムを構築する開発者向けに設計されています。これらのシステムは、さらなる分析の前に構造化データを必要とします。
特徴
- ユニバーサルフォーマット対応: DOC/DOCX、ODT、XLS/XLSX、CSV、TXT、JSON、PDF、HTML、および画像(PNG、JPG)を対応。
- 論理構造抽出: 見出しや任意のレベルのリストを含むツリー構造にドキュメントを変換。
- 高度なPDF処理: PDFのテキストレイヤーの正しさを自動で検証。
- 表認識: 複数ページにわたる複雑な表(明確な罫線付き)を輪郭分析を使用して表データを抽出。
- 拡張可能なアーキテクチャ: 新しいドキュメント形式の追加が容易で、出力データ形式も柔軟に変更可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト