ekimetrics/adaptive-chunking
Adaptive Chunking: automatically select the best chunking method per document for RAG. Accepted at LREC 2026.
What it solves
Adaptive Chunking 解決了在檢索增強生成 (RAG) 管線中,沒有單一分塊策略(例如:遞迴式、語義式或基於頁面的分塊)能對每個文件都達到最佳效果的問題。本框架不再使用固定方法,而是根據一組內在品質指標,自動為每個獨立的文件選擇最佳的分塊策略。
How it works
該系統透過五種不需要標準答案 (ground-truth) 的內在品質指標來評估多種分塊策略:
- Size Compliance (SC): 檢查分塊是否保持在目標 token 數量範圍內。
- Intrachunk Cohesion (ICC): 衡量分塊內句子與其整體嵌入 (embedding) 之間的語義相似度。
- Contextual Coherence (DCC): 衡量分塊與其周圍上下文的相似度。
- Block Integrity (BI): 確保段落、表格和列表等結構化區塊保持完整。
- Filtered Missing Reference Error (RC): 追蹤指代消解鏈 (entity-pronoun pairs) 是否在邊界處中斷。
根據這些分數,框架會選擇最佳策略。它支援模組化插件,用於新增分塊方法和評估指標,並與各種 PDF/Excel 解析後端 (Docling, PyMuPDF, Azure Document Intelligence) 整合。
Who it’s for
想要透過改進文件分塊方式來優化檢索完整性與回答正確性的 RAG 管線開發者與研究人員。
Highlights
- Automatic Strategy Selection: 動態地為每個文件選擇最佳的分塊方法。
- Intrinsic Evaluation: 使用五種指標在不需要標記數據的情況下對分塊品質進行評估。
- Modular Architecture: 可透過自定義分塊器與評分函數輕鬆擴展。
- Parsing Integration: 內建對多種 PDF 與 Azure 雲端解析後端的支持。
- Proven Performance: 證明在檢索完整性與回答正確性上,優於標準的遞迴式或基於頁面的分塊。"},