enoch3712/ExtractThinker
ExtractThinker is a Document Intelligence library for LLMs, offering ORM-style interaction for flexible and powerful document workflows.
解決する課題
ExtractThinkerは、非構造化ドキュメント(PDF、画像、スプレッドシートなど)を構造化された検証済みのPythonオブジェクトに変換するプロセスを簡素化します。Pydanticコントラクトを使用して必要なデータスキーマを定義できるため、複雑な解析ロジックを手動で記述する手間を省くことができます。
仕組み
このライブラリは、ドキュメントローダー、LLM、および検証のためのPydanticを組み合わせて使用します。ユーザーは Contract クラスを定義して、抽出したいフィールドと制約を指定します。その後、Extractor が選択されたパーサーを介してドキュメントを読み込み、LLMを通じてテキストを処理し、出力を検証済みのPydanticオブジェクトにマッピングします。複雑なワークフローのために、ドキュメント分類、混合バンドルの分割、および補完戦略による長い入力の処理を行うツールも含まれています。
対象ユーザー
さまざまなドキュメント形式から特定のデータを抽出し、結果として得られるデータが厳密な型および値のスキーマに準拠していることを確認する必要がある開発者向けに設計されています。
ハイライト
- 型付きデータ抽出: Pydanticコントラクトを使用して、抽出されたデータが検証済みであり、型付けされていることを保証します。
- ドキュメントの多様性: PDF、画像、テーブル、スプレッドシート用の複数のローダーをサポート(PyMuPDF、Camelot、Tabula、Adobeなど)。
- ワークフローツール: ドキュメント分類および分割のための組み込み機能を備えています。
- 柔軟なLLM統合: Ollamaを介して、さまざまなプロバイダーやローカルモデルと互換性があります。
- 高度な機能: 並列フィールド抽出、SQLiteを使用したページ取得、およびMCPサービスを提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト