ekimetrics/adaptive-chunking

Adaptive Chunking: automatically select the best chunking method per document for RAG. Accepted at LREC 2026.

What it solves

Adaptive Chunking 解決了在檢索增強生成 (RAG) 管線中,沒有單一分塊策略(例如:遞迴式、語義式或基於頁面的分塊)能對每個文件都達到最佳效果的問題。本框架不再使用固定方法,而是根據一組內在品質指標,自動為每個獨立的文件選擇最佳的分塊策略。

How it works

該系統透過五種不需要標準答案 (ground-truth) 的內在品質指標來評估多種分塊策略:

  • Size Compliance (SC): 檢查分塊是否保持在目標 token 數量範圍內。
  • Intrachunk Cohesion (ICC): 衡量分塊內句子與其整體嵌入 (embedding) 之間的語義相似度。
  • Contextual Coherence (DCC): 衡量分塊與其周圍上下文的相似度。
  • Block Integrity (BI): 確保段落、表格和列表等結構化區塊保持完整。
  • Filtered Missing Reference Error (RC): 追蹤指代消解鏈 (entity-pronoun pairs) 是否在邊界處中斷。

根據這些分數,框架會選擇最佳策略。它支援模組化插件,用於新增分塊方法和評估指標,並與各種 PDF/Excel 解析後端 (Docling, PyMuPDF, Azure Document Intelligence) 整合。

Who it’s for

想要透過改進文件分塊方式來優化檢索完整性與回答正確性的 RAG 管線開發者與研究人員。

Highlights

  • Automatic Strategy Selection: 動態地為每個文件選擇最佳的分塊方法。
  • Intrinsic Evaluation: 使用五種指標在不需要標記數據的情況下對分塊品質進行評估。
  • Modular Architecture: 可透過自定義分塊器與評分函數輕鬆擴展。
  • Parsing Integration: 內建對多種 PDF 與 Azure 雲端解析後端的支持。
  • Proven Performance: 證明在檢索完整性與回答正確性上,優於標準的遞迴式或基於頁面的分塊。"},