monarch-initiative/ontogpt
LLM-based ontological extraction tools, including SPIRES
解决的问题
OntoGPT 解决了使用 LLM 从文本中提取结构化数据时出现的幻觉和低效问题。具体来说,它防止模型虚构虚假的本体标识符,或无法遵守因过大而无法放入标准提示上下文窗口的复杂数据模式。
工作原理
OntoGPT 结合使用指令提示和基于本体的接地机制。它不直接要求 LLM 提供标识符,而是先请求名称,然后使用 OAK(Ontology Access Kit)标注器将这些名称与实际本体进行比对,验证每个标识符是否与源本体一致。为处理大型模式,它采用 SPIRES 方法,递归遍历 LinkML 模式,一次仅向模型提示一个类,以确保输出符合完整模式,同时避免上下文窗口过载。
适用人群
专为需要从大量文本(如科学论文)中提取高保真度、结构化的生物或技术知识,并确保提取数据基于现有权威本体的研究人员和开发者设计。
主要亮点
- 无幻觉的接地:所有标识符均与源本体进行验证,无法接地的术语将标记为
AUTO:前缀。 - 递归模式遍历:使用 SPIRES 方法处理复杂数据模型,无需将整个模式加载到提示中。
- 批量处理:支持对数千份文档进行重复提取,输出格式包括 YAML、JSON、RDF 和 OWL。
- 广泛模型支持:通过 LiteLLM 与 OpenAI、Anthropic、Mistral 等多种 LLM 提供商集成,并通过 Ollama 支持本地模型。
- 代理集成:包含“代理技能”,允许 AI 编码代理执行提取并管理模板。
相关
- 项目
- 项目
- 项目
- 项目