docling-project/docling

Get your documents ready for gen AI

何を解決するか

Doclingは、多様で複雑な文書形式を、生成AIアプリケーションに適した構造化・機械可読形式に変換するプロセスを簡素化します。LLMが直接処理しにくい高度なPDFレイアウト、表、およびマルチモーダルコンテンツ(画像や音声など)の解析という課題に対処します。

動作方法

Doclingは、PDF、Office文書、HTML、さらには動画/音声ファイルなど、さまざまなファイル形式を解析し、MarkdownやJSONなどの形式にエクスポートするための統一された文書表現形式である DoclingDocument を使用します。スキャンされた文書にはOCRを、高度なレイアウト理解には視覚言語モデル(VLM)を、音声/動画の字幕には自動音声認識(ASR)を活用しています。

対象ユーザー

AIエージェント、RAG(リトリーバー補強生成)パイプライン、文書処理ワークフローを構築する開発者向けに設計されています。未構造化文書をクリーンな構造化データに変換する必要がある方々に最適です。

主な特徴

  • マルチモーダル解析: PDF、DOCX、PPTX、XLSX、HTML、EPUB、メール形式、動画/音声ファイルなど、広範なフォーマットをサポート。
  • 高度なPDF理解: ページレイアウト、読み順、表構造、数式を処理可能。
  • AIエコシステム統合: LangChain、LlamaIndex、Crew AI、Haystack へのネイティブなプラグアンドプレイ対応。
  • ローカル実行: 敏感なデータやオフライン環境(エアギャップ)でもローカルで実行可能。
  • チャート理解: 棒グラフ、円グラフ、折れ線グラフなどを、詳細な説明付きの表やコードに変換。
  • 柔軟なエクスポート: Markdown、HTML、JSON、およびUSPTOやJATSなどの特定XMLスキーマへエクスポート可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト