run-llama/llama_index
LlamaIndex is the leading document agent and OCR platform
What it solves
LlamaIndex는 프라이빗 데이터로 대규모 언어 모델(LLM)을 증강하기 위해 설계된 데이터 프레임워크입니다. LLM이 사전 학습된 공개 데이터에만 국한되는 문제를 해결하기 위해, 지식 증강 생성을 위한 프라이빗 정보를 수집, 구조화 및 검색할 수 있는 툴킷을 제공합니다.
How it works
LlamaIndex는 데이터와 LLM 사이의 간극을 줄이기 위한 일련의 도구들을 제공합니다:
- Data Connectors: 다양한 소스 및 형식(PDFs, APIs, SQL, 등)에서 데이터를 수집합니다.
- Data Structuring: 데이터를 인덱스 또는 그래프로 조직화하여 LLM이 사용하기 적합한 상태로 만듭니다.
- Retrieval/Query Interface: LLM 프롬프트를 입력받아 검색된 프라이빗 데이터를 기반으로 문맥이 증강된 출력을 반환하는 고급 인터페이스입니다.
- Integrations: LangChain, Flask, 또는 Docker와 같은 다른 애플리케이션 프레임워크와 원활하게 연결됩니다.
Who it’s for
- Beginners: 몇 줄의 코드만으로 고수준 API를 사용하여 데이터를 수집하고 쿼리할 수 있는 입문자.
- Advanced Users: retrievers, query engines, 및 reranking modules와 같은 모듈을 사용자 정의하고 확장해야 하는 고급 사용자.
Highlights
- LLM, embeddings, 및 vector stores를 위한 300개 이상의 통합 패키지.
- 스타터 패키지 (
llama-index) 및 사용자 정의 코어 패키지 (llama-index-core) 지원. - 효율적인 재로딩을 위해 데이터를 디스크에 저장할 수 있는 기능.
- 에이전트형 OCR 및 구조화된 데이터 추출을 위한 LlamaParse와의 통합.