feyninc/chonkie
🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines
What it solves
Chonkie 是一个轻量级的摄取库,旨在简化并加速将文本切分为块以供 Retrieval‑Augmented Generation(RAG)流水线使用的过程。它消除了从头构建自定义块器的需求,并降低了大型、臃肿库带来的开销。
How it works
Chonkie 提供多种块化策略和管道系统,以将这些操作串联起来。它支持多种文本切分方法,包括:
- Fixed-size/Token-based: 使用
TokenChunker或 SIMD 加速的FastChunker。 - Structural/Hierarchical: 使用
RecursiveChunker(可自定义规则)或CodeChunker处理编程语言。 - Semantic: 使用
SemanticChunker(基于相似度)或SlumberChunker(使用 LLM 找到有意义的断点)。 - Specialized:
TableChunker用于 markdown 表格,NeuralChunker用于神经模型。
用户可以构建一个 Pipeline 来获取数据、分块、精炼(例如添加嵌入或合并重叠),并通过 “handshakes” 直接将其发送到向量数据库。
Who it’s for
构建 RAG 应用的开发者,需要一个快速、高效且支持多语言(支持 56 种语言)的文本切分工具,并且能够轻松集成现有的向量存储、嵌入提供商和 LLM。
Highlights
- Extensive Integrations: 超过 45 种集成,包括 10+ 向量数据库(ChromaDB、Pinecone、Qdrant 等)、16+ 嵌入提供商,以及 5+ LLM 提供商。
- High Performance: 基准测试显示相较于竞争替代品,速度更快且包体积更小。
- REST API Server: 可作为自托管的 API,便于集成到任何应用。
- Flexible Tokenization: 支持多种 tokenizer,包括 tiktoken、Hugging Face,以及自定义 token 计数函数。
- Agent-Ready: 为 AI 编码代理(如 Claude Code、Cursor)提供官方技能和插件。