feyninc/chonkie

🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines

What it solves

Chonkie は、Retrieval‑Augmented Generation(RAG)パイプライン向けにテキストをチャンクに分割するプロセスをシンプルかつ高速にする軽量インジェクションライブラリです。カスタムチャンクャーをゼロから作る必要がなくなり、巨大で肥大化したライブラリに伴うオーバーヘッドを削減します。

How it works

Chonkie はさまざまなチャンク化戦略と、これらの操作をチェーンできるパイプラインシステムを提供します。テキスト分割の方法は以下を含みます:

  • Fixed-size/Token-based: TokenChunker または SIMD 加速の FastChunker を使用。
  • Structural/Hierarchical: カスタマイズ可能なルールを持つ RecursiveChunker、またはプログラミング言語向けの CodeChunker
  • Semantic: 類似度に基づく SemanticChunker、または LLM を使って意味のある区切りを見つける SlumberChunker
  • Specialized: markdown テーブル用の TableChunker、ニューラルモデル用の NeuralChunker

ユーザーは Pipeline を構築し、データ取得、チャンク化、リファイン(埋め込みの追加やオーバーラップのマージなど)を行い、"handshakes" を通じて直接ベクトルデータベースへ送信できます。

Who it’s for

RAG アプリケーションを構築する開発者向けです。高速で効率的、かつ 56 言語に対応したテキスト分割ツールを求め、既存のベクトルストア、埋め込みプロバイダー、LLM と簡単に統合したい方に最適です。

Highlights

  • Extensive Integrations: 45 以上の統合、10 以上のベクトルデータベース(ChromaDB、Pinecone、Qdrant など)、16 以上の埋め込みプロバイダー、5 以上の LLM プロバイダーをサポート。
  • High Performance: ベンチマークで競合製品よりもはるかに高速かつパッケージサイズが小さいことが確認されています。
  • REST API Server: 任意のアプリケーションに簡単に組み込めるセルフホスト型 API として実行可能。
  • Flexible Tokenization: tiktoken、Hugging Face、カスタムトークンカウント関数など、さまざまなトークナイザーに対応。
  • Agent-Ready: Claude Code や Cursor などの AI コーディングエージェント向けに公式スキルとプラグインを提供。