feyninc/chonkie
🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines
What it solves
Chonkie 是一個輕量級的擷取函式庫,旨在簡化與加速將文字切分為區塊以供 Retrieval‑Augmented Generation(RAG)流程使用的過程。它免除自行從頭開發自訂切分器的需求,並降低大型、臃腫函式庫所帶來的負擔。
How it works
Chonkie 提供多樣的切分策略與管線系統,讓這些操作可以串接在一起。它支援多種文字切分方式,包括:
- Fixed-size/Token-based: 使用
TokenChunker或 SIMD 加速的FastChunker。 - Structural/Hierarchical: 使用
RecursiveChunker(可自訂規則)或CodeChunker針對程式語言。 - Semantic: 使用
SemanticChunker(基於相似度)或SlumberChunker(使用 LLM 找出有意義的斷點)。 - Specialized:
TableChunker用於 markdown 表格,NeuralChunker用於神經模型。
使用者可以建立 Pipeline 來取得資料、切分、精緻化(例如加入嵌入或合併重疊區塊),並透過「handshakes」直接將結果送入向量資料庫。
Who it’s for
開發 RAG 應用的開發者,需要一個快速、高效且支援多語言(支援 56 種語言)的文字切分工具,且能輕鬆整合現有的向量儲存、嵌入提供者與 LLM。
Highlights
- Extensive Integrations: 超過 45 種整合,包括 10+ 向量資料庫(ChromaDB、Pinecone、Qdrant 等)、16+ 嵌入提供者,以及 5+ LLM 提供者。
- High Performance: 基準測試顯示相較於競爭方案,速度更快、套件體積更小。
- REST API Server: 可作為自行託管的 API,方便整合至任何應用。
- Flexible Tokenization: 支援多種 tokenizer,包括 tiktoken、Hugging Face,以及自訂的 token 計算函式。
- Agent-Ready: 為 AI 程式碼代理(如 Claude Code、Cursor)提供官方技能與插件。