신뢰할 수 있는 문서 추출을 위한 olmOCR 파인튜닝

TNG는 중요한 헤더와 푸터 정보 누락을 특별히 해결하기 위해 내부 문서 처리 워크플로를 자동화하는 olmOCR 모델의 파인튜닝 버전을 개발했습니다. 이 수정은 olmOCR를 주로 LLM 학습 데이터 생성에 사용되는 도구에서 비즈니스 애플리케이션을 위한 모든 문서 텍스트를 캡처할 수 있는 신뢰할 수 있는 OCR 엔진으로 변환합니다.

파이프라인 기반 및 기존 olmOCR 시스템의 한계

전통적인 파이프라인 기반 OCR 엔진은 섹션 분할, 표 파싱, 문자 인식을 위한 연쇄된 머신러닝 구성 요소에 의존합니다. 이 접근 방식의 근본적인 결함은 컨텍스트를 논리적인 읽기 순서(선형화)로 평탄화하지 못한다는 점이며, 이는 다중 열 텍스트, 떠다니는 다이어그램, 헤더 및 푸터가 포함된 레이아웃이 풍부한 문서에 특히 문제를 일으킵니다.

olmOCR와 같은 비전 언어 모델(VLM)은 선형화 문제를 해결하지만, 원래의 olmOCR-7B-0225-preview는 헤더와 푸터를 의도적으로 제외하여 다음 토큰 예측을 위한 자연스러운 읽기 흐름을 유지하도록 만든 olmOCR-mix-0225 데이터셋으로 학습되었습니다. 결과적으로 원래 모델은 인보이스 파싱과 같은 비즈니스 사용 사례에 종종 중요한 여분의 정보를 무시합니다.

파인튜닝 과정 및 데이터셋 생성

신뢰할 수 있는 OCR 엔진을 만들기 위해 TNG는 Qwen2.5-VL-72B-Instruct를 활용하여 헤더와 푸터를 포함한 모든 관련 정보를 포착한 8,000개의 문서로 구성된 합성 데이터셋을 생성했습니다.

학습 구성

  • Base Model: olmOCR-7B-0225-preview
  • Hardware: 8xH100 Nvidia 노드
  • Training Pipeline: 오픈소스 olmOCR 학습 파이프라인
  • Hyperparameters: 기본 하이퍼파라미터를 사용했으며 4개의 그래디언트 누적 단계가 적용되었습니다
  • Duration: 2.5 epoch
  • Tracking: 실험 추적은 MLflow를 통해 수행되었습니다

평가를 위해 TNG는 Qwen2.5-VL-72B-Instruct가 생성한 헤더와 푸터 정보를 추가로 포함한 맞춤형 olmOCR-mix-0225 평가 데이터셋을 사용했습니다.

기능 및 성능 비교

파인튜닝된 모델은 "문서 앵커링" 프롬프트 전략을 사용하여 원시 텍스트 블록과 위치 정보를 추출해 래스터화된 이미지와 함께 VLM에 제공함으로써 디지털 원본 콘텐츠를 보존합니다.

정성적 평가 결과 파인튜닝된 모델이 원래의 olmOCR-7B-0225-preview보다 여러 핵심 영역에서 우수함을 보여줍니다:

  • Header and Footer Extraction: 모델은 이제 문서 상단과 하단에 위치한 중요한 정보를 추출합니다(예: 인보이스). 이는 원래 모델이 무시했던 부분입니다.
  • Layout Preservation: 모델은 복잡한 다중 열 레이아웃과 간단한 표를 파싱하는 능력을 유지합니다.
  • Faithfulness: 모델은 이전에 "여분" 데이터로 간주되던 것을 포함한 모든 텍스트를 포착하여 다운스트림 비즈니스 작업에 필요한 중요한 정보가 누락되지 않도록 합니다.

TNG는 추론 시 사용되는 temperature 설정에 따라 출력 품질이 크게 달라질 수 있음을 언급했습니다.

사용 가능 여부

파인튜닝된 모델은 오픈소스로 공개되었으며 Hugging Face에서 tngtech/olmOCR-7B-faithful 로 제공됩니다.

SUMMARY: TNG는 헤더와 푸터를 보존하는 파인튜닝된 olmOCR-7B-0225-preview 버전을 출시했으며, 이를 통해 인보이스 파싱과 같은 비즈니스 애플리케이션에 적합합니다.

Sources