ekimetrics/adaptive-chunking
Adaptive Chunking: automatically select the best chunking method per document for RAG. Accepted at LREC 2026.
What it solves
Adaptive Chunkingは、検索拡張生成 (RAG) パイプラインにおいて、単一のチャンク分割戦略(例:再帰的、セマンティック、またはページベース)がすべてのドキュメントに最適であるとは限らないという問題に対処します。固定された手法を使用する代わりに、このフレームワークは、一連の内在的な品質指標に基づいて、各ドキュメントに対して最適なチャンク分割戦略を自動的に選択します。
How it works
このシステムは、正解データ (ground-truth) を必要としない5つの内在的な品質指標を用いて、複数のチャンク分割戦略を評価します:
- Size Compliance (SC): チャンクが目標のトークン数範囲内に収まっているかを確認します。
- Intrachunk Cohesion (ICC): チャンク内の文章と、そのチャンク全体の埋め込み (embedding) との間の意味的な類似性を測定します。
- Contextual Coherence (DCC): チャンクとその周囲のコンテキストとの間の類似性を測定します。
- Block Integrity (BI): 段落、表、リストなどの構造的なブロックが維持されているかを確認します。
- Filtered Missing Reference Error (RC): 照応関係(エンティティと代名詞のペア)が境界を越えて切断されていないかを追跡します。
これらのスコアに基づき、フレームワークは最適な戦略を選択します。新しいチャンク分割手法や評価指標のためのモジュール式プラグインをサポートし、さまざまな PDF/Excel 解析バックエンド (Docling, PyMuPDF, Azure Document Intelligence) と統合可能です。
Who it’s for
ドキュメントの分割方法を改善することで、検索の完全性と回答の正確性を最適化したい、RAGパイプラインを構築する開発者や研究者。
Highlights
- Automatic Strategy Selection: ドキュメントごとに最適な分割方法を動的に選択します。
- Intrinsic Evaluation: ラベル付きデータなしでチャンクの品質をスコアリングするための5つの指標。
- Modular Architecture: カスタムの分割器やスコアリング関数で簡単に拡張可能です。
- Parsing Integration: 複数のPDFおよびAzureクラウド解析バックエンドを内蔵サポート。
- Proven Performance: 標準的な再帰的分割やページベースの分割と比較して、検索の完全性と回答の正確性が向上することが実証されています。