chonkie-inc/chonkie

🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines

What it solves

Chonkie 是一個輕量級的攝取函式庫,旨在簡化並加速 Retrieval‑Augmented Generation(RAG)管線的文字分塊過程。它消除了開發者必須從頭自行打造自訂分塊器的需求,降低了大型臃腫函式庫所帶來的負擔。

How it works

Chonkie 提供了一套多樣的分塊策略與管線系統,用以管理從原始文字到向量資料庫的資料流。主要元件包括:

  • Chunkers:各種文字切分方法,包含固定大小 token 分塊、SIMD 加速的位元組分塊、句子為單位、遞迴、語意相似度,以及神經網路/LLM 為基礎的切割。
  • Pipelines:將分塊、精煉(例如加入嵌入或合併重疊的塊)與匯出步驟串接,形成可重複使用的工作流程。
  • Integrations:針對向量資料庫(如 ChromaDB、Pinecone、Qdrant)、嵌入提供者(如 OpenAI、Cohere、Gemini)以及分詞器(如 tiktoken、Hugging Face)的廣泛「握手」生態系統。
  • API Server:自我託管的 REST API,設定儲存在本機 SQLite 資料庫中,使用者可將分塊管線作為服務執行。

Who it’s for

需要快速、高效且支援多語言(支援 56 種語言)文字切分工具,並希望與現有 AI 基礎設施無縫整合的 RAG 應用開發者。

Highlights

  • Diverse Chunking Methods:包含針對程式碼、表格與語意內容的專用分塊器。
  • High Performance:基準測試顯示其速度顯著更快,套件大小也遠小於競爭方案。
  • Pipeline API:同時支援同步與非同步處理,適用於高吞吐量應用。
  • Extensive Integrations:提供超過 45 種向量儲存、LLM 與嵌入模型的整合。
  • Agent‑Ready:為 Claude Code、Cursor 等 AI 程式碼代理提供官方技能與插件。