chonkie-inc/chonkie
🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines
What it solves
Chonkie 是一个轻量级的摄取库,旨在简化并加速 Retrieval‑Augmented Generation(RAG)流水线的文本分块过程。它消除了开发者从头构建自定义分块器的需求,降低了大型臃肿库带来的开销。
How it works
Chonkie 提供了一套多样的分块策略和流水线系统,用于管理从原始文本到向量数据库的数据流。主要组件包括:
- Chunkers:多种文本切分方法,包括固定大小 token 分块、SIMD 加速的字节级分块、基于句子、递归、语义相似度以及神经网络/LLM‑基分割。
- Pipelines:将分块、精炼(如添加嵌入或合并重叠块)和导出步骤串联起来,形成可复用的工作流。
- Integrations:面向向量数据库(如 ChromaDB、Pinecone、Qdrant)、嵌入提供商(如 OpenAI、Cohere、Gemini)以及分词器(如 tiktoken、Hugging Face)的广泛“握手”生态系统。
- API Server:自托管的 REST API,配置存储在本地 SQLite 数据库中,用户可以将分块流水线作为服务运行。
Who it’s for
需要快速、高效且支持多语言(支持 56 种语言)文本切分工具,并希望与现有 AI 基础设施无缝集成的 RAG 应用开发者。
Highlights
- Diverse Chunking Methods:包含针对代码、表格和语义含义的专用分块器。
- High Performance:基准测试显示其速度显著更快,包体积也远小于竞争方案。
- Pipeline API:同时支持同步和异步处理,适用于高吞吐量场景。
- Extensive Integrations:提供超过 45 种向量存储、LLM 和嵌入模型的集成。
- Agent‑Ready:为 Claude Code、Cursor 等 AI 编码代理提供官方技能和插件。