Mistral AI Voxtral Transcribe 2 출시

Mistral AI는 최첨단 전사 품질, 화자 분리(speaker diarization), 그리고 초저지연성을 위해 설계된 음성-텍스트 변환(speech-to-text) 모델 제품군인 Voxtral Transcribe 2를 출시했습니다. 이번 출시는 배치 처리를 위한 Voxtral Mini Transcribe V2와 실시간 애플리케이션을 위한 Voxtral Realtime의 두 가지 주요 모델로 구성됩니다.

Voxtral Realtime: 초저지연 스트리밍

Voxtral Realtime은 오디오를 청크 단위로 처리하는 대신 오디오가 도착하는 즉시 전사하는 새로운 스트리밍 아키텍처를 활용하여, 최소한의 지연이 필요한 실시간 애플리케이션을 위해 설계되었습니다.

주요 성능 지표

  • Latency: 지연 시간은 200ms 미만까지 설정 가능하여 응답성이 뛰어난 음성 에이전트를 구현할 수 있습니다.
  • Accuracy vs. Delay: 480ms 지연 시, 모델은 1-2% 이내의 단어 오류율(WER)을 유지합니다. 2.4초 지연 시에는 Voxtral Mini Transcribe V2 배치 모델의 정확도와 일치합니다.
  • Model Size and Deployment: 4B 파라미터 규모로, 개인정보 보호를 우선시하는 애플리케이션을 위해 엣지 디바이스에 배포할 수 있습니다.
  • Licensing: Voxtral Realtime은 Apache 2.0 라이선스 하에 오픈 웨이트(open-weights)로 출시되었습니다.

언어 지원

Voxtral Realtime은 영어, 중국어, 힌디어, 스페인어, 아랍어, 프랑스어, 포르투갈어, 러시아어, 독일어, 일본어, 한국어, 이탈리아어, 네덜란드어 등 13개 언어를 지원하는 네이티브 멀티링구얼 모델입니다.

Voxtral Mini Transcribe V2: 고효율 배치 전사

Voxtral Mini Transcribe V2는 높은 정확도의 배치 전사 및 화자 분리를 위해 최적화되었습니다. FLEURS 벤치마크에서 약 4%의 단어 오류율을 달성하였으며, 분당 $0.003의 가격으로 제공됩니다.

기술적 역량

  • Speaker Diarization: 모델은 화자 라벨과 정확한 시작/종료 시간을 포함한 전사 결과를 생성합니다. 음성이 겹치는 경우, 모델은 일반적으로 한 명의 화자를 전사합니다.
  • Context Biasing: 사용자는 기술 용어, 이름 또는 도메인 특화 어휘의 정확한 철자를 유도하기 위해 최대 100개의 단어 또는 구절을 제공할 수 있습니다. 이 기능은 영어에 최적화되어 있으며, 다른 언어에 대해서는 실험적 지원을 제공합니다.
  • Word-Level Timestamps: 모델은 모든 단어에 대해 정확한 시작 및 종료 타임스탬프를 제공하여 자막 생성 및 오디오 검색을 용이하게 합니다.
  • Audio Capacity: 모델은 단일 요청으로 최대 3시간 분량의 녹음 파일을 처리할 수 있습니다.
  • Noise Robustness: 시스템은 야외 녹음, 혼잡한 콜센터, 공장 바닥 등 까다로운 음향 환경에서도 정확도를 유지합니다.

벤치마크 및 경쟁력

Voxtral Mini Transcribe V2는 Voxtral Realtime과 동일한 13개 언어를 지원합니다. Mistral AI는 이 모델이 정확도 면에서 GPT-4o mini Transcribe, Gemini 2.5 Flash, Assembly Universal, 그리고 Deepgram Nova를 능가한다고 보고했습니다. 또한, ElevenLabs의 Scribe v2보다 약 3배 빠르게 오디오를 처리하며, 비용은 5분의 1 수준으로 동일한 품질을 제공합니다.

구현 및 도구

Mistral Studio Audio Playground

Mistral Studio에서 즉시 테스트할 수 있는 오디오 플레이그라운드를 사용할 수 있습니다. .mp3, .wav, .m4a, .flac, .ogg 파일을 각각 최대 1GB까지 지원합니다. 사용자는 화자 분리 기능을 켜고 끌 수 있으며, 타임스탬프 정밀도를 조정하고 컨텍스트 바이어스(context bias) 용어를 추가할 수 있습니다.

Pricing and Availability

  • Voxtral Mini Transcribe V2: API를 통해 분당 $0.003에 이용 가능합니다.
  • Voxtral Realtime: API를 통해 분당 $0.006에 이용 가능하며, Hugging Face에서 오픈 웨이트로 제공됩니다.
  • Compliance: 두 모델 모두 프라이빗 클라우드 또는 보안 온프레미스 설정을 통해 GDPR 및 HIPAA 준수를 지원하는 배포를 지원합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch