feyninc/chonkie

🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines

What it solves

Chonkie 是一个轻量级的摄取库,旨在简化并加速将文本切分为块以供 Retrieval‑Augmented Generation(RAG)流水线使用的过程。它消除了从头构建自定义块器的需求,并降低了大型、臃肿库带来的开销。

How it works

Chonkie 提供多种块化策略和管道系统,以将这些操作串联起来。它支持多种文本切分方法,包括:

  • Fixed-size/Token-based: 使用 TokenChunker 或 SIMD 加速的 FastChunker
  • Structural/Hierarchical: 使用 RecursiveChunker(可自定义规则)或 CodeChunker 处理编程语言。
  • Semantic: 使用 SemanticChunker(基于相似度)或 SlumberChunker(使用 LLM 找到有意义的断点)。
  • Specialized: TableChunker 用于 markdown 表格,NeuralChunker 用于神经模型。

用户可以构建一个 Pipeline 来获取数据、分块、精炼(例如添加嵌入或合并重叠),并通过 “handshakes” 直接将其发送到向量数据库。

Who it’s for

构建 RAG 应用的开发者,需要一个快速、高效且支持多语言(支持 56 种语言)的文本切分工具,并且能够轻松集成现有的向量存储、嵌入提供商和 LLM。

Highlights

  • Extensive Integrations: 超过 45 种集成,包括 10+ 向量数据库(ChromaDB、Pinecone、Qdrant 等)、16+ 嵌入提供商,以及 5+ LLM 提供商。
  • High Performance: 基准测试显示相较于竞争替代品,速度更快且包体积更小。
  • REST API Server: 可作为自托管的 API,便于集成到任何应用。
  • Flexible Tokenization: 支持多种 tokenizer,包括 tiktoken、Hugging Face,以及自定义 token 计数函数。
  • Agent-Ready: 为 AI 编码代理(如 Claude Code、Cursor)提供官方技能和插件。