ekimetrics/adaptive-chunking
Adaptive Chunking: automatically select the best chunking method per document for RAG. Accepted at LREC 2026.
What it solves
Adaptive Chunking 解决了在检索增强生成 (RAG) 流水线中,没有单一分块策略(例如:递归、语义或基于页面的分块)能对每个文档都达到最佳效果的问题。本框架不再使用固定方法,而是根据一组内在质量指标,自动为每个独立文档选择最佳的分块策略。
How it works
该系统通过五种不需要标准答案 (ground-truth) 的内在质量指标来评估多种分块策略:
- Size Compliance (SC): 检查分块是否保持在目标 token 数量范围内。
- Intrachunk Cohesion (ICC): 衡量分块内句子与整体嵌入 (embedding) 之间的语义相似度。
- Contextual Coherence (DCC): 衡量分块与周围上下文的相似度。
- Block Integrity (BI): 确保段落、表格和列表等结构化块保持完整。
- Filtered Missing Reference Error (RC): 追踪指代消解链 (entity-pronoun pairs) 是否在边界处断开。
根据这些分数,框架会选择最佳策略。它支持模块化插件,用于新增分块方法和评估指标,并与各种 PDF/Excel 解析后端 (Docling, PyMuPDF, Azure Document Intelligence) 集成。
Who it’s for
想要通过改进文档分块方式来优化检索完整性和回答正确性的 RAG 流水线开发者和研究人员。
Highlights
- Automatic Strategy Selection: 动态地为每个文档选择最佳的分块方法。
- Intrinsic Evaluation: 使用五种指标在不需要标注数据的情况下对分块质量进行评分。
- Modular Architecture: 易于通过自定义分块器和评分函数进行扩展。
- Parsing Integration: 内置对多种 PDF 和 Azure 云端解析后端的支持。
- Proven Performance: 证明在检索完整性和回答正确性上,优于标准的递归或页面分块。