ekimetrics/adaptive-chunking
Adaptive Chunking: automatically select the best chunking method per document for RAG. Accepted at LREC 2026.
What it solves
Adaptive Chunking은 검색 증강 생성(RAG) 파이프라인에서 단일 청킹 전략(예: 재귀적, 의미론적 또는 페이지 기반)이 모든 문서에 최적의 결과를 내지 못한다는 문제를 해결합니다. 고정된 방법을 사용하는 대신, 이 프레임워크는 일련의 내재적 품질 지표를 기반으로 각 개별 문서에 대해 최적의 청킹 전략을 자동으로 선택합니다.
How it works
이 시스템은 정답(ground-truth)이 필요 없는 5가지 내재적 품질 지표를 사용하여 여러 청킹 전략을 평가합니다:
- Size Compliance (SC): 청크가 목표 토큰 수 범위를 유지하는지 확인합니다.
- Intrachunk Cohesion (ICC): 청크 내 문장과 전체 임베딩(embedding) 간의 의미론적 유사성을 측정합니다.
- Contextual Coherence (DCC): 청크와 주변 문맥 간의 유사성을 측정합니다.
- Block Integrity (BI): 단락, 표, 리스트와 같은 구조적 블록이 온전하게 유지되는지 확인합니다.
- Filtered Missing Reference Error (RC): 핵심 참조 체인(개체-대명사 쌍)이 경계를 넘어 끊어지는지 추적합니다.
이러한 점수를 바탕으로 프레임워크는 최적의 전략을 선택합니다. 새로운 청킹 방법과 평가 지표를 위한 모듈식 플러그인을 지원하며, 다양한 PDF/Excel 파싱 백엔드(Docling, PyMuPDF, Azure Document Intelligence)와 통합됩니다.
Who it’s for
문서 분할 방식을 개선하여 검색 완결성과 답변 정확도를 최적화하고자 하는 RAG 파이프라인 구축 개발자 및 연구자.
Highlights
- Automatic Strategy Selection: 문서별로 최적의 분할 방법을 동적으로 선택합니다.
- Intrinsic Evaluation: 레이블이 지정된 데이터 없이도 청킹 품질을 점수화할 수 있는 5가지 지표.
- Modular Architecture: 커스텀 스플리터와 스코어링 함수로 쉽게 확장 가능합니다.
- Parsing Integration: 여러 PDF 및 Azure 클라우드 파싱 백엔드를 기본적으로 지원합니다.
- Proven Performance: 표준 재귀적 또는 페이지 분할 방식보다 검색 완결성과 답변 정확도가 향상됨을 입증했습니다.