feyninc/chonkie

🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines

What it solves

Chonkie 是一個輕量級的擷取函式庫,旨在簡化與加速將文字切分為區塊以供 Retrieval‑Augmented Generation(RAG)流程使用的過程。它免除自行從頭開發自訂切分器的需求,並降低大型、臃腫函式庫所帶來的負擔。

How it works

Chonkie 提供多樣的切分策略與管線系統,讓這些操作可以串接在一起。它支援多種文字切分方式,包括:

  • Fixed-size/Token-based: 使用 TokenChunker 或 SIMD 加速的 FastChunker
  • Structural/Hierarchical: 使用 RecursiveChunker(可自訂規則)或 CodeChunker 針對程式語言。
  • Semantic: 使用 SemanticChunker(基於相似度)或 SlumberChunker(使用 LLM 找出有意義的斷點)。
  • Specialized: TableChunker 用於 markdown 表格,NeuralChunker 用於神經模型。

使用者可以建立 Pipeline 來取得資料、切分、精緻化(例如加入嵌入或合併重疊區塊),並透過「handshakes」直接將結果送入向量資料庫。

Who it’s for

開發 RAG 應用的開發者,需要一個快速、高效且支援多語言(支援 56 種語言)的文字切分工具,且能輕鬆整合現有的向量儲存、嵌入提供者與 LLM。

Highlights

  • Extensive Integrations: 超過 45 種整合,包括 10+ 向量資料庫(ChromaDB、Pinecone、Qdrant 等)、16+ 嵌入提供者,以及 5+ LLM 提供者。
  • High Performance: 基準測試顯示相較於競爭方案,速度更快、套件體積更小。
  • REST API Server: 可作為自行託管的 API,方便整合至任何應用。
  • Flexible Tokenization: 支援多種 tokenizer,包括 tiktoken、Hugging Face,以及自訂的 token 計算函式。
  • Agent-Ready: 為 AI 程式碼代理(如 Claude Code、Cursor)提供官方技能與插件。