Mistral OCR 4.1 출시 – 가격, 기능 및 커뮤니티 반응

TL;DR

Mistral AI는 2026년 7월 16일 OCR 4.1을 발표했습니다. 이는 문단 수준의 경계 상자 추출, 구조적 블록 레이블, 신뢰도 점수를 추가한 공개 사전 보기 OCR 서비스로, 가격은 1,000페이지당 €3.5 (또는 구조적 레이블과 신뢰도 점수 포함된 어노테이션 출력 시 €4.38)입니다. 발표는 모델의 속도 우수성, 비용에 대한 우려, 기존 OCR 솔루션과의 비교 성능에 대해 활발한 Hacker News 논의를 촉발했습니다.


OCR 4.1가 제공하는 기능

주요 기능

  • 문단 수준의 경계 상자 – API는 각 문단의 좌표를 반환하여 하류 레이아웃 분석을 가능하게 합니다.
  • 구조적 블록 레이블 – 사용자 정의 프롬프트 없이도 감지된 블록을 (예: 헤더, 표, 그림) 분류합니다.
  • 블록 수준의 신뢰도 점수 – 각 추출된 요소에 품질 관리를 위한 신뢰도 메트릭이 포함됩니다.
  • 배치 처리 엔드포인트/v1/batch를 통해 문서를 대량으로 제출할 수 있으며, 커뮤니티 멤버에 따르면 배치 모드 가격에 50% 할인 혜택이 제공됩니다.

가격

  • 1,000페이지당 €3.5 – 원시 OCR 출력물
  • 1,000페이지당 €4.38 – 어노테이션 출력물 (구조적 레이블 및 신뢰도 점수 포함)

접근성


커뮤니티의 속도 및 비용 평가

"정확도에 대해서는 말하지 않겠지만, 내부 벤치마크에서 Mistral OCR은 유사한 API보다 훨씬 빠릅니다." – ianhawes (HN 댓글)

"누군가 관심 있다면, 제가 임대한 GPU에서 OCR 파이프라인을 운영하고 있습니다. 약 1,000페이지당 $0.05~$0.10 USD로 처리되며, 페이지당 약 0.8초, 전체 경계 상자 지원이 가능합니다. 1,000페이지당 3.5달러는 너무 비싸요..." – piterrro (HN 댓글)

일반적인 평가는 속도가 강점이라는 점입니다. 여러 사용자가 페이지당 1초 미만의 지연 시간을 보고했습니다. 그러나 가격이 주요 문제점입니다. 1,000페이지당 €3.5의 가격은 커뮤니티 멤버들이 공유한 DIY GPU 파이프라인보다 약 70배 더 비쌉니다.


정확도 및 사용 사례 적합성

"저는 리그처, 프라크투르, 하위 인덱스 등이 포함된 책 스캔을 가지고 있습니다. OpenAI의 '프로' 모델들이 여전히 우세합니다. 심지어 최고 성능 모델들도 저와 같은 복잡한 텍스트에서는 상당히 나쁜 성능을 보입니다." – ComputerPerson

"Mistral은 손글씨 OCR에서 매우 좋았습니다. 새로운 모델들이 다양한 언어에서 더 나아지기를 기대합니다." – Utkarsh736

"Bleak House의 한 장에서 헤더, 제목, 참고문헌을 일관되게 추출하고 태깅할 수 있었지만, 오른쪽 마진의 줄 번호는 어려움을 겪었습니다 (5개 중 3개 정확). 프롬프트 없이 PDF 업로드만으로 가능했습니다." – fumeux_fume

이러한 댓글들은 OCR 4.1이 표준 인쇄 텍스트와 단순 레이아웃에서는 잘 작동하지만, 복잡한 타이포그래피, 역사적 글꼴, 마진 주석에서는 어려움을 겪는다는 점을 시사합니다. 손글씨 텍스트는 전망이 좋지만, 구체적인 벤치마크는 아직 부족합니다.


기능 부족 및 비교 요청

커뮤니티 멤버들은 구체적인 비교를 요청했습니다:

  • Baidu Unlimited OCR과의 비교Johnny_Bonk는 성능과 비용에 대해 궁금해합니다.
  • Tesseract/OcrMyPDF와의 비교felooboolooomba는 벤치마크 수치를 요청합니다.
  • 비라틴 문자 체계einpoklum은 모델이 중국어, 아랍어, 데바나가리어 등과 같은 언어를 어떻게 처리하는지 묻습니다.
  • 레이아웃이 풍부한 문서(그림, 표 포함)ks2048는 입력/출력 쌍과 경계 상자 데이터를 보여주는 데모 사이트를 요청합니다.

발표에서 공식 벤치마크 데이터나 공개 데모 URL은 제공되지 않아, 이 질문들은 여전히 답이 없습니다.


가격 트렌드 및 시장 위치

"Mistral은 이 제품의 가격을 매 릴리스마다 올리고 있습니다. 지금은 2배 정도 되지 않았을까요?" – parhamn

"이게 Tesseract처럼 빠르지 않다면, 가치가 없습니다." – merb

커뮤니티는 릴리스 간 가격 상승을 인식하고 있으며, 오픈소스 대안 대비 모델의 가치 제안에 대한 우려를 표합니다. 일부 사용자는 속도와 API 편의성이 고처리량 상용 파이프라인에서는 비용을 정당화할 수 있다고 주장하지만, 다른 사용자들은 소규모 프로젝트에는 부담스럽다고 보고 있습니다.


지리적 및 언어적 고려사항

"이 모델이 다른 언어보다 프랑스어(그리고 기타 유럽 언어) 문서에서 더 잘 작동하는지 궁금합니다." – oliveralbertini

"지금쯤은 유럽이 AI 경쟁에서 중요한 역할을 할 것이라는 희망을 모두 잃었습니다." – king_crimson

이러한 발언들은 다국어 성능에 대한 불확실성과 유럽의 AI OCR 기술 경쟁력에 대한 전반적인 회의감을 드러냅니다.


핵심 요약

  • OCR 4.1은 문단 수준의 기하학적 정보와 구조적 레이블을 추가하여 레이아웃 인식이 필요한 문서 AI 워크플로우를 타겟으로 합니다.
  • 속도는 초기 사용자들로부터 칭찬을 받고 있으며, 페이지당 1초 미만의 지연 시간이 보고되었습니다.
  • 비용은 주요 문제점입니다. 1,000페이지당 €3.5는 DIY GPU 파이프라인보다 훨씬 높으며, 채택을 제한할 수 있습니다.
  • 일반 인쇄 텍스트에 대해서는 정확도가 우수하지만, 복잡한 타이포그래피, 마진 주석, 전용 스크립트에서는 성능이 떨어집니다.
  • 커뮤니티는 벤치마크 및 비교 데이터에 대한 요구가 여전히 충족되지 않았으며, Tesseract, Baidu OCR, OpenAI의 비전 모델과 같은 기존 솔루션과의 비교에 대해 많은 질문이 남아 있습니다.

모든 발언은 위에 링크된 Mistral OCR 4.1 문서 및 Hacker News 토론 스레드에서 직접 인용되었습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch