Mistral AI Voxtral 릴리스
Mistral AI는 저정확도의 오픈소스 ASR 시스템과 고가의 전용 API 사이의 격차를 메우기 위해 설계된 최첨단 음성 이해 모델인 Voxtral을 발표했습니다. Voxtral은 높은 정확도의 음성 전사와 내장된 의미 이해 기능을 제공하며, 생산 규모 애플리케이션용 24B 버전과 로컬 및 엣지 배포용 3B 버전 두 가지 크기로 제공되며, 모두 Apache 2.0 라이선스 하에 공개됩니다.
주요 기능 및 기술 사양
Voxtral 모델은 Mistral Small 3.1 및 Ministral 백본의 텍스트 이해 능력과 음성 처리 기능을 통합하여, 별도의 음성 인식(ASR) 모델과 언어 모델을 연결할 필요 없이 복잡한 작업을 수행할 수 있습니다.
오디오 처리 및 컨텍스트
- 컨텍스트 창: Voxtral은 32k 토큰의 컨텍스트 길이를 지원하여 최대 30분 분량의 오디오 파일을 전사하고, 최대 40분 분량의 오디오 콘텐츠를 이해할 수 있습니다.
- 내장 다국어 지원: 모델은 자동 언어 감지 기능을 갖추고 있으며, 영어, 스페인어, 프랑스어, 포르투갈어, 힌디어, 독일어, 네덜란드어, 이탈리아어 등 널리 사용되는 언어에서 높은 성능을 발휘합니다.
기능적 능력
- 통합 Q&A 및 요약: 사용자는 오디오 콘텐츠에 대해 직접 질문하거나, 구조화된 요약을 내장된 방식으로 생성할 수 있습니다.
- 직접 함수 호출: 사용자의 음성 의도에 따라 백엔드 함수, 워크플로우 또는 API 호출을 직접 트리거할 수 있어 중간 파싱 단계가 필요 없습니다.
- 텍스트 전문성: 언어 모델 백본의 기능을 유지하기 때문에, Voxtral 모델은 Mistral Small 3.1 및 Ministral의 즉시 대체 가능한 대안으로 사용할 수 있습니다.
성능 벤치마크
Voxtral은 오픈소스 및 전용 대안과 비교해 음성 전사 및 오디오 이해 작업에서 뛰어난 성능을 보입니다.
음성 전사
Voxtral은 Whisper large-v3, GPT-4o mini Transcribe, Gemini 2.5 Flash를 모두 상회하며 모든 평가 작업에서 최고 성능을 기록했습니다. 영어 단편 전사 및 Mozilla Common Voice 15.1 벤치마크에서 최첨단 성능을 달성했습니다. FLEURS 벤치마크에서는 Voxtral Small이 Whisper보다 모든 작업에서 우수하며, 여러 유럽어에서 최첨단 성능을 달성했습니다.
오디오 이해 및 번역
Voxtral Small은 오디오 이해 작업에서 GPT-4o-mini 및 Gemini 2.5 Flash와 경쟁력 있는 성능을 보입니다. 또한 FLEURS-Translation 벤치마크에서 음성 번역 분야에서도 최첨단 성능을 기록했습니다.
배포 및 가격
Voxtral은 다양한 배포 요구에 맞춰 여러 채널을 통해 제공됩니다:
- 로컬 배포: 24B 및 3B 모델 모두 Hugging Face를 통해 다운로드 가능합니다.
- API 접근: 전사 최적화 버전인 Voxtral Mini Transcribe는 Mistral AI API를 통해 제공되며, 분당 $0.001부터 시작합니다. Mistral AI는 이 버전이 OpenAI Whisper보다 비용의 절반 미만으로도 우수한 성능을 발휘한다고 주장합니다.
- Le Chat: Voxtral은 웹 및 모바일 사용자를 위한 Le Chat의 음성 모드에 통합되고 있습니다.
기업용 및 향후 로드맵
기업 사용자를 위해 Mistral AI는 사내 생산 규모 배포, 도메인별 특화 미세조정(예: 법적 또는 의료 분야), 전용 통합 지원을 제공합니다.
향후 기능 업데이트
Mistral AI는 Voxtral의 오디오 기능을 다음과 같이 확장하고 있습니다:
- 화자 분할
- 단어 수준 타임스탬프
- 비음성 오디오 인식
- 감정 및 나이에 대한 오디오 마크업
연구 문서
Voxtral의 연구 및 개발에 관한 상세한 기술 정보는 공식 연구 논문(arXiv:2507.13264)에서 확인할 수 있습니다.
Sources
- OriginalVoxtral
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch