monarch-initiative/ontogpt

LLM-based ontological extraction tools, including SPIRES

何を解決するか

OntoGPTは、テキストから構造化データを抽出する際のLLMの幻覚と非効率性という問題に対処します。特に、モデルが架空のオントロジー識別子を生成したり、標準的なプロンプトコンテキストウィンドウに収まらないほど大きな複雑なデータスキーマに従わないことを防ぎます。

動作方法

OntoGPTは、指示プロンプトとオントロジーに基づく接地の組み合わせを使用します。LLMに識別子を求めるのではなく、名前を求めてからOAK(Ontology Access Kit)アノテーターを使用して、実際のオントロジーと照合し、すべての識別子をそのソースと検証します。大規模なスキーマを扱うために、SPIRES手法を採用しています。これはLinkMLスキーマを再帰的に走査し、1つのクラスずつモデルにプロンプトを送ることで、コンテキストウィンドウをオーバーロードせずに完全なスキーマに準拠した出力を保証します。

対象ユーザー

生物学的または技術的知識を大量のテキスト(科学論文など)から高精度で構造化して抽出し、抽出されたデータが既存の権威あるオントロジーに基づいていることを保証したい研究者や開発者向けに設計されています。

特徴

  • 幻覚のない接地: すべての識別子をソースオントロジーと照合し、接地できない用語には AUTO: プレフィックスを付与します。
  • 再帰的スキーマ走査: SPIRES手法により、プロンプトに全体のスキーマを読み込まずに複雑なデータモデルを扱えます。
  • バッチ処理: YAML、JSON、RDF、OWLなどの出力形式で、数千のドキュメントに対して繰り返し抽出が可能です。
  • 広範なモデル対応: LiteLLMを介してOpenAI、Anthropic、MistralなどさまざまなLLMプロバイダーに対応し、Ollamaを介してローカルモデルもサポートします。
  • エージェント統合: AIコーディングエージェントが抽出を実行し、テンプレートを管理できる「エージェントスキル」を含んでいます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト