ekimetrics/adaptive-chunking

Adaptive Chunking: automatically select the best chunking method per document for RAG. Accepted at LREC 2026.

What it solves

Adaptive Chunking 解决了在检索增强生成 (RAG) 流水线中,没有单一分块策略(例如:递归、语义或基于页面的分块)能对每个文档都达到最佳效果的问题。本框架不再使用固定方法,而是根据一组内在质量指标,自动为每个独立文档选择最佳的分块策略。

How it works

该系统通过五种不需要标准答案 (ground-truth) 的内在质量指标来评估多种分块策略:

  • Size Compliance (SC): 检查分块是否保持在目标 token 数量范围内。
  • Intrachunk Cohesion (ICC): 衡量分块内句子与整体嵌入 (embedding) 之间的语义相似度。
  • Contextual Coherence (DCC): 衡量分块与周围上下文的相似度。
  • Block Integrity (BI): 确保段落、表格和列表等结构化块保持完整。
  • Filtered Missing Reference Error (RC): 追踪指代消解链 (entity-pronoun pairs) 是否在边界处断开。

根据这些分数,框架会选择最佳策略。它支持模块化插件,用于新增分块方法和评估指标,并与各种 PDF/Excel 解析后端 (Docling, PyMuPDF, Azure Document Intelligence) 集成。

Who it’s for

想要通过改进文档分块方式来优化检索完整性和回答正确性的 RAG 流水线开发者和研究人员。

Highlights

  • Automatic Strategy Selection: 动态地为每个文档选择最佳的分块方法。
  • Intrinsic Evaluation: 使用五种指标在不需要标注数据的情况下对分块质量进行评分。
  • Modular Architecture: 易于通过自定义分块器和评分函数进行扩展。
  • Parsing Integration: 内置对多种 PDF 和 Azure 云端解析后端的支持。
  • Proven Performance: 证明在检索完整性和回答正确性上,优于标准的递归或页面分块。