chonkie-inc/chonkie

🦛 CHONK docs with Chonkie ✨ — The lightweight ingestion library for fast, efficient and robust RAG pipelines

What it solves

Chonkie は、Retrieval‑Augmented Generation(RAG)パイプライン向けのテキスト分割処理をシンプルかつ高速にするために設計された軽量なインジェストライブラリです。開発者がゼロからカスタムチャンクャーを作る必要をなくし、肥大化したライブラリに伴うオーバーヘッドを削減します。

How it works

Chonkie は、多様なチャンクング戦略とパイプラインシステムを提供し、生テキストからベクトルデータベースへのデータフローを管理します。主なコンポーネントは次のとおりです。

  • Chunkers: 固定サイズトークンチャンク、SIMD 加速バイトベースチャンク、文ベース、再帰的、意味的類似度、ニューラル/LLM ベースの分割など、さまざまなテキスト分割手法。
  • Pipelines: チャンクング、リファイン(埋め込みの追加や重複チャンクのマージなど)およびエクスポートステップをチェーン化し、再利用可能なワークフローを構築できるシステム。
  • Integrations: ベクトルデータベース(例: ChromaDB、Pinecone、Qdrant)や埋め込みプロバイダー(例: OpenAI、Cohere、Gemini)、トークナイザー(例: tiktoken、Hugging Face)向けの幅広い「ハンドシェイク」エコシステム。
  • API Server: ローカル SQLite データベースに設定を保存し、チャンクングパイプラインをサービスとして実行できる自己ホスト型 REST API。

Who it’s for

高速で効率的、かつ多言語(56 言語対応)なテキスト分割ツールを必要とし、既存の AI インフラとシームレスに統合したい RAG アプリケーション開発者向け。

Highlights

  • Diverse Chunking Methods: コード、テーブル、意味的内容に特化したチャンクャーを含む。
  • High Performance: 競合他社と比較して、はるかに高速かつパッケージサイズが小さいことがベンチマークで示されています。
  • Pipeline API: 同期処理と非同期処理の両方をサポートし、高スループットアプリケーションに対応。
  • Extensive Integrations: ベクトルストア、LLM、埋め込みモデルを合わせて 45 以上の統合を提供。
  • Agent‑Ready: Claude Code や Cursor などの AI コーディングエージェント向けに公式スキルとプラグインを提供。