chonkie-inc/chonkie

🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines

What it solves

Chonkie 是一个轻量级的摄取库,旨在简化并加速 Retrieval‑Augmented Generation(RAG)流水线的文本分块过程。它消除了开发者从头构建自定义分块器的需求,降低了大型臃肿库带来的开销。

How it works

Chonkie 提供了一套多样的分块策略和流水线系统,用于管理从原始文本到向量数据库的数据流。主要组件包括:

  • Chunkers:多种文本切分方法,包括固定大小 token 分块、SIMD 加速的字节级分块、基于句子、递归、语义相似度以及神经网络/LLM‑基分割。
  • Pipelines:将分块、精炼(如添加嵌入或合并重叠块)和导出步骤串联起来,形成可复用的工作流。
  • Integrations:面向向量数据库(如 ChromaDB、Pinecone、Qdrant)、嵌入提供商(如 OpenAI、Cohere、Gemini)以及分词器(如 tiktoken、Hugging Face)的广泛“握手”生态系统。
  • API Server:自托管的 REST API,配置存储在本地 SQLite 数据库中,用户可以将分块流水线作为服务运行。

Who it’s for

需要快速、高效且支持多语言(支持 56 种语言)文本切分工具,并希望与现有 AI 基础设施无缝集成的 RAG 应用开发者。

Highlights

  • Diverse Chunking Methods:包含针对代码、表格和语义含义的专用分块器。
  • High Performance:基准测试显示其速度显著更快,包体积也远小于竞争方案。
  • Pipeline API:同时支持同步和异步处理,适用于高吞吐量场景。
  • Extensive Integrations:提供超过 45 种向量存储、LLM 和嵌入模型的集成。
  • Agent‑Ready:为 Claude Code、Cursor 等 AI 编码代理提供官方技能和插件。