docling-project/docling
Get your documents ready for gen AI
何を解決するか
Doclingは、多様で複雑な文書形式を、生成AIアプリケーションに適した構造化・機械可読形式に変換するプロセスを簡素化します。LLMが直接処理しにくい高度なPDFレイアウト、表、およびマルチモーダルコンテンツ(画像や音声など)の解析という課題に対処します。
動作方法
Doclingは、PDF、Office文書、HTML、さらには動画/音声ファイルなど、さまざまなファイル形式を解析し、MarkdownやJSONなどの形式にエクスポートするための統一された文書表現形式である DoclingDocument を使用します。スキャンされた文書にはOCRを、高度なレイアウト理解には視覚言語モデル(VLM)を、音声/動画の字幕には自動音声認識(ASR)を活用しています。
対象ユーザー
AIエージェント、RAG(リトリーバー補強生成)パイプライン、文書処理ワークフローを構築する開発者向けに設計されています。未構造化文書をクリーンな構造化データに変換する必要がある方々に最適です。
主な特徴
- マルチモーダル解析: PDF、DOCX、PPTX、XLSX、HTML、EPUB、メール形式、動画/音声ファイルなど、広範なフォーマットをサポート。
- 高度なPDF理解: ページレイアウト、読み順、表構造、数式を処理可能。
- AIエコシステム統合: LangChain、LlamaIndex、Crew AI、Haystack へのネイティブなプラグアンドプレイ対応。
- ローカル実行: 敏感なデータやオフライン環境(エアギャップ)でもローカルで実行可能。
- チャート理解: 棒グラフ、円グラフ、折れ線グラフなどを、詳細な説明付きの表やコードに変換。
- 柔軟なエクスポート: Markdown、HTML、JSON、およびUSPTOやJATSなどの特定XMLスキーマへエクスポート可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト