shcherbak-ai/contextgem

ContextGem: Effortless LLM extraction from documents

What it solves

ContextGem は、ドキュメントから構造化データと洞察を抽出するプロセスを簡素化します。信頼性の高い構造化抽出を行うために通常必要となる、複雑な抽出プロンプトの作成、検証モデルの設計、および出力をソース参照にマッピングする作業を排除します。

How it works

ContextGem は、ユーザーが自然言語で「何を」抽出するかを記述し、フレームワークが「どのように」行うかを処理する宣言的なアプローチを採用しています。

  1. Define Extraction Context: ソース資料のテキストまたは視覚的コンテンツを含む Document オブジェクトが作成されます。

  2. Run LLM Extraction: (LiteLLM を介してクラウドまたはローカルモデルをサポート) DocumentLLM を設定し、ドキュメントを処理して定義された aspects と concepts を抽出します。

Who it’s for

個々のドキュメント (契約書、請求書、レポートなど) の深い、構造化分析が必要なアプリケーションを構築している開発者で、単一ドキュメントタスクにおける従来の RAG 検索のリスクを回避したいと考えている方です。

Highlights

  • Granular Reference Mapping: 抽出されたデータに対して、正確な段落および文レベルの参照を提供します。

  • Automated Prompting and Modeling: 動的なプロンプト生成とデータモデリングを自動的に処理します。

  • Built-in Justifications: 抽出された情報に対して、自動的に根拠付けを生成します。

  • Hierarchical Extraction: ネストされたコンテキスト抽出をサポートし、aspects が他の aspects または concepts を含めることができます。

  • Broad LLM Support: LiteLLM を介して、さまざまなクラウドおよびローカル LLM と統合可能です。