Mistral AI Voxtral リリース

Mistral AIは、低精度なオープンソースのASRシステムと高価なプロプライエタリAPIの間のギャップを埋めるために設計された、最先端の音声理解モデルファミリーであるVoxtralを導入しました。Voxtralは、高精度な文字起こしとネイティブな意味理解を提供します。本モデルは、プロダクション規模のアプリケーション向けの24Bバリアントと、ローカルおよびエッジ展開向けの3Bバリアントの2つのサイズで提供され、どちらもApache 2.0ライセンスの下でリリースされています。

主要な機能と技術仕様

Voxtralモデルは、音声処理とMistral Small 3.1およびMinistralバックボーンのテキスト理解能力を統合しています。これにより、モデルは、個別の自動音声認識(ASR)と言語モデルを連結させる必要なく、複雑なタスクを実行できます。

音声処理とコンテキスト

  • Context Window: Voxtralは32kトークンのコンテキスト長をサポートしており、最大30分の音声ファイルの文字起こしと、最大40分の音声コンテンツの理解を可能にします。
  • Native Multilingualism: モデルは自動言語検出機能を備えており、英語、スペイン語、フランス語、ポルトガル語、ヒンディー語、ドイツ語、オランダ語、イタリア語を含む、広く使用されている言語において高いパフォーマンスを発揮します。

機能的機能

  • Integrated Q&A and Summarization: ユーザーは音声コンテンツについて直接質問したり、ネイティブに構造化された要約を生成したりできます。
  • Direct Function Calling: Voxtralは、話されたユーザーの意図に基づいてバックエンドの関数、ワークフロー、またはAPIコールをトリガーできます。これにより、中間的なパース工程を排除できます。
  • Text Proficiency: 言語モデルのバックボーンの能力を保持しているため、VoxtralモデルはMistral Small 3.1およびMinistralのドロップイン・リプレースメントとして機能することができます。

パフォーマンス・ベンチマーク

Voxtralは、文字起こしおよび音声理解タスクにおいて、オープンソースおよびプロプライエタリな代替手段の両方と比較して優れたパフォーマンスを示しています。

音声文字起こし

Voxtralは、Whisper large-v3、GPT-4o mini Transcribe、およびGemini 2.5 Flashのすべての評価タスクにおいて、Whisperを上回っています。英語の短形式文字起こしおよびMozilla Common Voice 15.1ベンチマークにおいて、最先端の結果を達成しています。FLEURSベンチマークにおいて、Voxtral SmallはWhisperをすべてのタスクで上回り、いくつかのヨーロッパ言語において最先端のパフォーマンスに到達しています。

音声理解と翻訳

Voxtral Smallは、音声理解タスクにおいてGPT-4o-miniおよびGemini 2.5 Flashと競合しています。また、FLEURS-Translationベンチマークにおける音声翻訳において、最先端のパフォーマンスを達成しています。

デプロイメントと価格設定

Voxtralは、さまざまなデプロイメントのニーズに合わせて、複数のチャネルを通じて提供されます:

  • Local Deployment: 24Bおよび3Bモデルは、Hugging Face経由でダウンロード可能です。
  • API Access: 文字起こしに最適化されたバージョンであるVoxtral Mini Transcribeは、Mistral AI APIを通じて、1分あたり$0.001から利用可能です。Mistral AIは、このバージョンがOpenAI Whisperよりも半額以下のコストで、より高いパフォーマンスを発揮すると主張しています。
  • Le Chat: Voxtralは、Webおよびモバイルユーザー向けのLe Chatの音声モードに統合されています。

エンタープライズおよび将来のロードマップ

エンタープライズユーザー向けに、Mistral AIは、プライベートなプロダクション規模のデプロイメント、ドメイン固有のファインチューニング(例:法律または医療の文脈における)、および専用の統合サポートを提供しています。

将来の機能アップデート

Mistral AIは、Voxtralの音声能力を拡張するために、以下の機能の拡張に取り組んでいます:

  • Speaker segmentation
  • Word-level timestamps
  • Non-speech audio recognition
  • Audio markups for emotion and age

研究用ドキュメント

Voxtralの研究および開発に関する詳細な技術情報は、公式の研究論文(arXiv:2507.13264)で確認できます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch