Docmatix 데이터셋 출시
데이터셋 규모 및 구성
Docmatix는 이전 DocVQA 데이터셋에 비해 규모가 240배 증가한 것을 나타냅니다. Idefics2와 같은 모델에 이전에 사용된 주요 데이터셋은 10,000장의 이미지와 39,000개의 질문-답변(Q/A) 쌍을 포함했지만, Docmatix는 다음을 제공합니다:
- Images: 240만
- Q/A Pairs: 950만
- Source Material: 130만 개의 PDF 문서
생성 파이프라인 및 품질 관리
Docmatix는 210만 개의 PDF를 포함하는 PDFA OCR 데이터셋을 사용하여 생성되었습니다. 기술 파이프라인은 다음 단계로 구성되었습니다:
- Transcription and Generation: PDFA에서 추출된 전사본을 Phi-3-small 모델로 처리하여 Q/A 쌍을 생성했습니다.
- Filtering: 데이터 품질을 유지하기 위해 생성된 Q/A 쌍의 15%를 환각으로 판단해 폐기했습니다. 필터링은 코드 탐지를 위한 정규식과 "unanswerable" 키워드가 포함된 답변을 제거하는 방식으로 수행되었습니다.
- Image Conversion: PDF를 150 dpi 해상도의 이미지로 변환한 뒤 Hugging Face Hub에 업로드하여 최종 사용자의 변환 리소스 부담을 줄였습니다.
프롬프트 최적화 및 다양성
데이터셋을 최적화하기 위해 Hugging Face는 초기 소규모 데이터 배치에 대해 ablation 연구를 수행하여 Phi-3 모델의 프롬프트를 개선했습니다. 최적화 목표는 다음과 같습니다:
- Density: 페이지당 약 4개의 Q/A 쌍을 목표로 하여 중복(너무 많은 쌍)이나 상세 부족(너무 적은 쌍)을 방지합니다.
- Human-like Responses: 답변이 지나치게 짧지도 길지도 않도록 합니다.
- Diversity: 문서 내 특정 정보를 기반으로 질문하도록 Phi-3 모델을 유도하여 반복을 최소화합니다(예: "What are the titles of John Doe?").
성능 벤치마크
평가는 Florence-2 모델(700M 파라미터)을 사용하여 수행되었습니다. 두 버전의 Florence-2를 비교했으며, 하나는 표준 DocVQA 데이터셋에 파인튜닝하고, 다른 하나는 Docmatix의 일부(이미지의 20%, Q/A 쌍의 4%)에 파인튜닝한 뒤 DocVQA에서 한 epoch을 추가로 진행하여 형식을 맞췄습니다.
| 데이터셋 | DocVQA에서 ANSL | 모델 크기 |
|---|---|---|
| Florence-2 fine-tuned on DocVQA | 60.1 | 700M |
| Florence-2 fine-tuned on Docmatix | 71.4 | 700M |
| Idefics2 | 74.0 | 8B |
결과는 Docmatix에 파인튜닝된 700M 파라미터의 Florence-2 모델이 8B 파라미터의 Idefics2 모델보다 5% 정도만 낮은 성능을 보였으며, 대규모 데이터셋의 효율성을 입증합니다.