shcherbak-ai/contextgem
ContextGem: Effortless LLM extraction from documents
What it solves
ContextGem은 문서에서 구조화된 데이터와 통찰을 추출하는 프로세스를 단순화합니다. 신뢰할 수 있는 구조화된 추출을 위해 일반적으로 필요한 복잡한 추출 프롬프트 작성, 검증 모델 설계, 그리고 출력을 출처 참조로 매핑하는 작업을 수동으로 수행할 필요가 없습니다.
How it works
ContextGem은 사용자가 자연어로 "what"을 추출할지 기술하는 선언적 방식을 사용하며, 프레임워크가 "how"를 처리합니다.
Define Extraction Context: 소스 자료의 텍스트 또는 시각적 콘텐츠를 포함하는
Document객체가 생성됩니다.Define Extraction Targets: 사용자는 Aspects (주제나 테마와 같은 텍스트 세그먼트를 추출하기 위한 것)와 Concepts (엔티티, 사실, 또는 분류와 같은 특정 데이터 포인트를 추출하기 위한 것)를 정의합니다.
Run LLM Extraction:
DocumentLLM을 설정하여 (LiteLLM을 통해 클라우드 또는 로컬 모델을 지원) 문서를 처리하고 정의된 aspects와 concepts를 추출합니다.
Highlights
Granular Reference Mapping: 추출된 데이터에 대해 정밀한 단락 및 문장 수준의 참조를 제공합니다.
Automated Prompting and Modeling: 동적 프롬프트 생성 및 데이터 모델링을 자동으로 처리합니다.
Built-in Justifications: 추출된 정보에 대해 자동으로 근거를 생성합니다.
Summary: Hierarchical Extraction: 계층층적 추출을 지원하여, aspects가 다른 aspects나 concepts를 포함할 수 있도록 합니다.
Broad LLM Support: LiteLLM을 통해 다양한 클라우드 및 로컬 LLM과 통합됩니다.