monarch-initiative/ontogpt

LLM-based ontological extraction tools, including SPIRES

解決的問題

OntoGPT 解決了使用 LLM 從文字中提取結構化資料時產生的幻覺與效率問題。具體而言,它防止模型虛構假造的本體識別碼,或無法遵守因過大而無法放入標準提示上下文視窗的複雜資料模式。

工作原理

OntoGPT 結合使用指令提示與基於本體的接地機制。它不直接要求 LLM 提供識別碼,而是先請求名稱,然後使用 OAK(Ontology Access Kit)標註器將這些名稱與實際本體進行比對,驗證每個識別碼是否與來源一致。為處理大型模式,它採用 SPIRES 方法,遞迴遍歷 LinkML 模式,一次僅向模型提示一個類別,以確保輸出符合完整模式,同時避免上下文視窗過載。

適用對象

專為需要從大量文字(如科學論文)中提取高保真度、結構化的生物或技術知識,並確保提取資料基於現有權威本體的研究人員與開發者設計。

主要亮點

  • 無幻覺的接地:所有識別碼均與來源本體進行驗證,無法接地的術語將標記為 AUTO: 前綴。
  • 遞迴模式遍歷:使用 SPIRES 方法處理複雜資料模型,無需將整個模式載入提示中。
  • 批量處理:支援對數千份文件進行重複提取,輸出格式包括 YAML、JSON、RDF 和 OWL。
  • 廣泛模型支援:透過 LiteLLM 與 OpenAI、Anthropic、Mistral 等多種 LLM 提供商整合,並透過 Ollama 支援本地模型。
  • 代理整合:包含「代理技能」,允許 AI 編碼代理執行提取並管理範本。

相關

  • 專案
  • 專案
  • 專案
  • 專案