monarch-initiative/ontogpt

LLM-based ontological extraction tools, including SPIRES

해결하는 문제

OntoGPT는 텍스트에서 구조화된 데이터를 추출할 때 LLM의 환각 현상과 비효율성을 해결합니다. 특히, 모델이 가짜 온톨로지 식별자를 만들어내거나, 표준 프롬프트 컨텍스트 창에 들어가지 못할 정도로 큰 복잡한 데이터 스키마를 제대로 따르지 못하는 문제를 방지합니다.

작동 방식

OntoGPT는 지시 프롬프트와 온톨로지 기반의 지식 기반을 결합하여 작동합니다. LLM에게 식별자를 요청하는 대신 이름을 요청한 후, OAK(Ontology Access Kit) 어노테이터를 사용하여 실제 온톨로지와 일치시켜 각 식별자가 원천과 일치하는지 검증합니다. 대규모 스키마를 처리하기 위해 SPIRES 방법을 사용하며, LinkML 스키마를 재귀적으로 탐색하여 하나의 클래스씩 모델에 프롬프트를 보내서 전체 스키마에 부합하는 출력을 보장하면서 컨텍스트 창을 과부하시키지 않습니다.

대상 사용자

대량의 텍스트(예: 과학 논문)에서 생물학적 또는 기술적 지식을 고정밀도로 구조화하여 추출하고, 추출된 데이터가 기존의 권위 있는 온톨로지에 기반하고 있음을 보장해야 하는 연구자 및 개발자에게 적합합니다.

주요 기능

  • 환각 없는 지식 기반: 모든 식별자를 원천 온톨로지와 비교하여 검증하며, 지식 기반 불가능한 용어에는 AUTO: 접두사를 붙입니다.
  • 재귀적 스키마 탐색: SPIRES 방법을 사용해 전체 스키마를 프롬프트에 로드하지 않고도 복잡한 데이터 모델을 처리할 수 있습니다.
  • 배치 처리: YAML, JSON, RDF, OWL 등의 출력 형식으로 수천 개의 문서에 대해 반복 추출이 가능합니다.
  • 다양한 모델 지원: LiteLLM를 통해 OpenAI, Anthropic, Mistral 등 다양한 LLM 제공업체와 연동되며, Ollama를 통해 로컬 모델도 지원합니다.
  • 에이전트 통합: AI 코드 에이전트가 추출을 수행하고 템플릿을 관리할 수 있는 "에이전트 기술"을 포함하고 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트