docling-project/docling-graph
Transform unstructured documents into validated, rich and queryable knowledge graphs.
何を解決するか
Docling Graphは、複雑なドキュメント(PDF、画像、Officeファイルなど)から構造化された高精度データを抽出し、有向知識グラフに変換する問題を解決します。標準的なRAGシステムが近似テキスト埋め込みに依存するのに対し、このツールはエンティティ間の正確な意味的関係(たとえば、化学化合物と反応、金融商品とその依存関係)を保証します。化学、金融、法務などの専門分野において不可欠です。
動作方法
システムは設定駆動型パイプラインを使用し、ドキュメントを検証済みのPydanticオブジェクトに変換し、その後NetworkXの有向グラフに変換します。主に2つの抽出パスをサポート:Doclingを介したローカルVLM(ビジョン・ランゲージモデル)抽出、またはLiteLLMを介したLLMベースの抽出(OpenAI、Gemini、vLLMなど複数プロバイダーに対応)。ユーザーはPydanticテンプレートを使って抽出スキーマを定義でき、手動で作成したり、例文ドキュメントから誘導したり、既存のオントロジー(OWL/RDFS)からコンパイルできます。
対象ユーザー
高精度ドメイン(法務、金融、化学研究など)で作業する開発者やデータサイエンティスト向けです。非構造化ドキュメントを厳密な検証とデータの根拠に基づいた機械可読知識グラフに変換する必要がある方々に最適です。
特徴
- テンプレート生成:例文ドキュメントからPydanticテンプレートを自動的に誘導、または正式なオントロジーからコンパイル可能。
- データの根拠:抽出元の正確な位置(バウンディングボックス幾何学)を記録する決定論的プロバンスレジャーフレームワークを提供。
- 柔軟なバックエンド:ローカル実行環境(Ollama、vLLM)とリモートAPIの両方に対応するVLMおよびLLM抽出をサポート。
- グラフ統合:複数の知識グラフを1つの監査可能で決定論的なグラフに統合可能。追加のLLM呼び出し不要。
- 広範なフォーマット対応:Docling統合により、PDF、画像、Markdown、Officeファイルを処理可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト