feyninc/chonkie

🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines

What it solves

Chonkie는 Retrieval‑Augmented Generation(RAG) 파이프라인을 위해 텍스트를 청크로 나누는 과정을 단순화하고 가속화하도록 설계된 경량 인제스트 라이브러리입니다. 맞춤형 청커를 처음부터 만들 필요가 없으며, 크고 무거운 라이브러리와 관련된 오버헤드를 줄여줍니다.

How it works

Chonkie는 다양한 청킹 전략과 이러한 작업을 체인으로 연결할 수 있는 파이프라인 시스템을 제공합니다. 텍스트 분할 방법은 다음을 포함합니다:

  • Fixed-size/Token-based: TokenChunker 또는 SIMD 가속 FastChunker 사용.
  • Structural/Hierarchical: 사용자 정의 규칙이 가능한 RecursiveChunker 또는 프로그래밍 언어용 CodeChunker.
  • Semantic: 유사도 기반 SemanticChunker 또는 의미 있는 구분점을 찾기 위해 LLM을 활용하는 SlumberChunker.
  • Specialized: markdown 테이블용 TableChunker와 신경 모델용 NeuralChunker.

사용자는 Pipeline을 구축하여 데이터를 가져오고, 청크화하고, 정제(예: 임베딩 추가 또는 겹침 병합)한 뒤, "handshakes"를 통해 직접 벡터 데이터베이스에 전송할 수 있습니다.

Who it’s for

RAG 애플리케이션을 구축하는 개발자를 위한 도구입니다. 빠르고 효율적이며 56개 언어를 지원하는 텍스트 분할 도구가 필요하고, 기존 벡터 스토어, 임베딩 제공자 및 LLM과 쉽게 통합하고자 하는 경우에 적합합니다.

Highlights

  • Extensive Integrations: 45개 이상의 통합, 10개 이상의 벡터 데이터베이스(ChromaDB, Pinecone, Qdrant 등), 16개 이상의 임베딩 제공자, 5개 이상의 LLM 제공자를 포함.
  • High Performance: 벤치마크 결과, 경쟁 대안보다 훨씬 빠르고 패키지 크기가 작습니다.
  • REST API Server: 자체 호스팅 API로 실행 가능해 어떤 애플리케이션에도 손쉽게 통합할 수 있습니다.
  • Flexible Tokenization: tiktoken, Hugging Face, 커스텀 토큰 카운팅 함수 등 다양한 토크나이저를 지원합니다.
  • Agent-Ready: Claude Code, Cursor와 같은 AI 코딩 에이전트를 위한 공식 스킬 및 플러그인을 제공합니다.