Mistral OCR 3 Release Notes
Mistral AI는 다양한 문서 유형에서 텍스트와 이미지를 높은 충실도로 추출하도록 설계된 문서 파싱 모델인 Mistral OCR 3의 출시를 발표했습니다. 이 모델은 양식, 스캔된 문서, 복잡한 표, 필기체를 처리하는 정확도를 크게 향상시켜 Mistral OCR 2 대비 74%의 전체 승률을 달성했습니다.
Technical Capabilities and Document Support
Mistral OCR 3는 기존의 많은 OCR 솔루션의 전문화된 범위를 넘어, 다양한 조직적 및 일상적 문서 유형을 처리할 수 있도록 설계되었습니다. 주요 기술적 업그레이드는 다음과 같습니다:
- Handwriting Recognition: 모델은 필기체 텍스트, 혼합 콘텐츠 주석, 인쇄된 양식 위에 겹쳐진 필기 입력을 정확하게 해석합니다.
- Form Processing: Mistral OCR 3는 밀집된 레이아웃 내의 레이블, 상자 및 필기 입력을 감지하는 능력이 향상되어 송장, 영수증 및 정부 문서에 적합합니다.
- Scanned Document Robustness: 시스템은 낮은 DPI, 배경 노이즈, 기울기, 왜곡 및 압축 아티팩트에 대해 더 강력한 복원력을 가집집니다.
- Complex Table Reconstruction: 모델은 병합된 셀, 열 계층 구조 및 다중 행 블록을 포함한 표 구조를 재구성합니다. 원래 레이아웃을 보존하기 위해
colspan및rowspan을 사용하는 HTML 표 태그를 출력합니다.
Integration and Output Formats
Mistral OCR 3는 HTML 기반의 표 재구성 기능이 강화된 markdown 출력을 지원하여, 다운스트림 시스템이 콘텐츠와 구조를 모두 이해할 수 있도록 합니다.
개발자는 모델 식별자 mistral-ocr-2512를 사용하여 API를 통해 모델을 통합할 수 있습니다. 또한 Mistral AI Studio의 Document AI Playground를 통해 모델을 사용할 수 있으며, 드래그 앤 드롭 인터페이스를 통해 PDF와 이미지를 깨끗한 텍스트나 구조화된 JSON으로 파싱할 수 있습니다.
Pricing and Deployment Options
Mistral OCR 3는 대부분의 경쟁 솔루션에 비해 더 작은 모델로, 경쟁력 있는 가격 구조를 가능하게 합니다:
- Standard API Pricing: $2 per 1,000 pages.
- Batch-API Discount: 50% 할인을 통해 비용을 1,000페이지당 $1로 낮출 수 있습니다.
엄격한 데이터 프라이버시 및 규제 요구 사항이 있는 조직을 위해, Mistral AI는 민감한 정보가 조직 자체 인프라 내에 유지되도록 보장하는 셀프 호스팅 옵션을 제공합니다.
Recommended Use Cases
Mistral OCR 3는 대량의 엔터프라이즈 파이프라인 및 대화형 워크플로우를 위해 설계되었으며, 다음을 포함합니다:
- 지식 시스템 및 AI 에이전트를 위한 문서의 markdown 변환.
- 운영 문서, 송장 및 양식의 파싱 자동화.
- 역사적 또는 필기 아카이브의 디지털화.
- 엔드 투 엔드 문서 이해 파이프라인 구축.
AI 및 자동화 분야의 IDC 연구 디렉터인 Tim Law는 "OCR은 생성형 AI와 에이전틱 AI를 가능하게 하는 기초로 남아 있습니다"라고 언급하며, 고충실도 추출이 조직 데이터에 더 풍부한 문맥을 제공하고 경쟁 우위를 제공한다고 말했습니다.
Sources
- OriginalIntroducing Mistral OCR 3
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch