DharmaOCR: 브라질 포르투갈어 OCR에서의 전문화 장점

DharmaOCR: 브라질 포르투갈어 OCR에서의 전문화 장점

DharmaOCR은 타깃 파인튜닝과 Direct Preference Optimization(DPO)를 통해 모든 모델 매개변수를 단일 도메인에 집중시킴으로써 브라질 포르투갈어 문서에서 Mistral OCR4 및 Unlimited-OCR과 같은 최신 일반 모델보다 성능이 뛰어납니다.

도메인 전문화 vs. 다언어 범위

전문화는 유한한 모델 매개변수의 할당을 최적화함으로써 일반 모델에 비해 구조적 장점을 제공합니다. 다언어 모델은 N개의 언어에 걸쳐 표현 용량을 분배해야 하는 반면, DharmaOCR과 같은 전문화된 모델은 단일 대상 언어의 특정 어휘, 형태학, 맞춤법 패턴에 모든 매개변수를 할당합니다.

이러한 자원 집중은 모델이 일반 모델이 자주 놓치는 언어적 미묘함을 포착할 수 있게 합니다. 예를 들어, ENEM 에세이(브라질의 전국 고등 학교 시험)를 사용한 벤치마크에서 일반 모델은 브라질에서 전국적으로 인정받는 인물과 구문, 예를 들어 "Chico Buarque"를 올바르게 전사하지 못했으나, DharmaOCR은 이를 올바르게 처리했습니다. 이는 일반 모델이 무작위로 실패하는 것이 아니라, 특정 언어를 더 넓은 다언어 코퍼스와 구별하는 어휘와 고유 명사에서 구체적으로 실패함을 보여줍니다.

성능 벤치마크

포르투갈어에 초점을 맞춘 평가에서 DharmaOCR은 자체 데뷔 이후 출시된 최신かつ 더 많은 자원을 갖춘 모델보다 월등히 뛰어난 성능을 보였습니다:

모델 추출 품질 점수
DharmaOCR 0.925
Mistral OCR4 0.798
Unlimited-OCR 0.7587

DharmaOCR은 Mistral OCR4보다 약 13점, Unlimited-OCR보다 16점 이상 앞서 있으며, 이는 더 최근의 건축적 발전에도 불구하고 도메인 전문화가 여전히 효과적임을 입증합니다.

DPO를 통한 텍스트 퇴화 해결

텍스트 퇴화—모델이 반복적, 비논리적, 또는 의미적으로 분리된 출력을 생성하는 경우—는 생산 OCR에서 중요한 실패 모드이며, 일반적으로 작은 글꼴이나 스캔 품질 저하와 같은 시각적 모호함에 의해 유발됩니다.

DharmaOCR은 다음과 같은 두 단계 훈련 파이프라인을 통해 이를 완화합니다:

  1. Supervised Fine-Tuning (SFT): 이 단계는 모델 가중치를 브라질 포르투갈어의 어휘 및 문서 구조와 맞춤하여 도메인 역량을 구축합니다.
  2. Direct Preference Optimization (DPO): SFT가 토큰을 단계별로 예측하는 것과 달리, DPO는 완전한 출력의 품질에 대해 모델을 훈련시킵니다. 완전한 추출의 일관성을 기반으로 경쟁 응답 사이에서 구별하도록 모델을 가르침으로써, DPO는 퇴화를 유발하는 표류와 반복 루프를 억제합니다.

이 접근 방식은 Mistral OCR4와 같은 일반 모델이 소스 문서와 완전히 분리된 출력을 생성할 수 있는 조건에서도 모델이 안정적으로 유지되도록 보장합니다.

전문화의 구조적 논리

새로운 아키텍처와 확장된 데이터세트는 모든 모델의 절대 성능 한계를 아마도 높일 것이지만, 전문화의 상대적 장점은 지속됩니다. 구조적 동력은 동일하게 유지됩니다: 단일 도메인에 모든 자원을 집중하는 시스템은 그 도메인에서 자원으로부터 더 많은 가치를 추출할 수 있으며, 많은 도메인에 자원을 분산하는 시스템보다 더 많은 가치를 추출할 수 있습니다.

DharmaOCR의 전략은 새로운 아키텍처와 정렬 방법과 같은 신흥 프론티어 기술을 브라질 포르투갈어 OCR이라는 고정된 도메인에 구체적으로 적용하여 가능한 가장 낮은 비용과 추론 시간으로 가능한 가장 높은 추출 품질을 유지하는 것입니다.

Sources