monarch-initiative/ontogpt

LLM-based ontological extraction tools, including SPIRES

解决的问题

OntoGPT 解决了使用 LLM 从文本中提取结构化数据时出现的幻觉和低效问题。具体来说,它防止模型虚构虚假的本体标识符,或无法遵守因过大而无法放入标准提示上下文窗口的复杂数据模式。

工作原理

OntoGPT 结合使用指令提示和基于本体的接地机制。它不直接要求 LLM 提供标识符,而是先请求名称,然后使用 OAK(Ontology Access Kit)标注器将这些名称与实际本体进行比对,验证每个标识符是否与源本体一致。为处理大型模式,它采用 SPIRES 方法,递归遍历 LinkML 模式,一次仅向模型提示一个类,以确保输出符合完整模式,同时避免上下文窗口过载。

适用人群

专为需要从大量文本(如科学论文)中提取高保真度、结构化的生物或技术知识,并确保提取数据基于现有权威本体的研究人员和开发者设计。

主要亮点

  • 无幻觉的接地:所有标识符均与源本体进行验证,无法接地的术语将标记为 AUTO: 前缀。
  • 递归模式遍历:使用 SPIRES 方法处理复杂数据模型,无需将整个模式加载到提示中。
  • 批量处理:支持对数千份文档进行重复提取,输出格式包括 YAML、JSON、RDF 和 OWL。
  • 广泛模型支持:通过 LiteLLM 与 OpenAI、Anthropic、Mistral 等多种 LLM 提供商集成,并通过 Ollama 支持本地模型。
  • 代理集成:包含“代理技能”,允许 AI 编码代理执行提取并管理模板。

相关

  • 项目
  • 项目
  • 项目
  • 项目