Mistral AI Voxtral 發佈
Mistral AI 推出了 Voxtral,這是一個最先進的語音理解模型系列,旨在彌合低準確度的開源 ASR 系統與昂貴的專有 API 之間的差距。Voxtral 提供高準確度的轉錄與原生語義理解,提供兩種尺寸——24B 版本適用於生產規模的應用,3B 版本適用於本地與邊緣部署——兩者皆在 Apache 2.0 授權下發佈。
關鍵能力與技術規格
Voxtral 模型將語音處理與 Mistral Small 3.1 及 Ministral 骨幹網路的文本理解能力相結合。這使得模型能夠執行複雜任務,而無需串聯獨立的自動語音辨識 (ASR) 與語言模型。
音訊處理與上下文
- 上下文窗口: Voxtral 支援 32k token 上下文長度,能夠轉錄長達 30 分鐘的音訊檔案,並理解長達 40 分鐘的音訊內容。
- 原生多語言能力: 這些模型具備自動語言偵測功能,並在廣泛使用的語言中表現優異,包括 English、Spanish、French、Portuguese、Hindi、German、Dutch 與 Italian。
功能能力
- 整合式問答與摘要: 使用者可以直接針對音訊內容提問,或原生生成結構化摘要。
- 直接函式呼叫: Voxtral 可以根據使用者說出的意圖觸發後端函式、工作流或 API 呼叫,消除了對中間解析步驟的需求。
- 文本精通度: 由於保留了其語言模型骨幹網路的能力,Voxtral 模型可以作為 Mistral Small 3.1 與 Ministral 的直接替換方案。
性能基準測試
與開源及專有替代方案相比,Voxtral 在轉錄與音訊理解任務中展現了卓越的性能。
語音轉錄
Voxtral 的表現優於 Whisper large-v3、GPT-4o mini Transcribe 以及 Gemini 2.5 Flash,涵蓋了所有評估任務。它在 English 短篇轉錄與 Mozilla Common Voice 15.1 基準測試中達到了最先進的技術水平 (SOTA)。在 FLEURS 基準測試中,Voxtral Small 的表現優於 Whisper,並在幾種歐洲語言中達到了最先進的性能。
音訊理解與翻譯
Voxtral Small 在音訊理解任務中可與 GPT-4o-mini 與 Gemini 2.5 Flash 競爭。它在 FLEURS-Translation 基準測試的語音翻譯任務中也達到了最先進的性能。
部署與定價
Voxtral 可透過多種管道提供,以滿足不同的部署需求:
- 本地部署: 24B 與 3B 模型皆可透過 Hugging Face 下載。
- API 存取: 一個針對轉錄優化的版本 Voxtral Mini Transcribe,可透過 Mistral AI API 使用,起價為每分鐘 $0.001 美元。Mistral AI 聲稱此版本在成本不到一半的情況下,表現優於 OpenAI Whisper。
- Le Chat: Voxtral 正被整合進 Le Chat 的語音模式,供網頁與行動裝置使用者使用。
企業與未來發展藍圖
對於企業使用者,Mistral AI 提供私有化生產規模部署、特定領域微調(例如:法律或醫療情境)以及專屬整合支援。
未來功能更新
Mistral AI 正致力於擴展 Voxtral 的音訊能力,包括:
- 講者分割 (Speaker segmentation)
- 單字級時間戳 (Word-level timestamps)
- 非語音音訊辨識
- 用於情緒與年齡的音訊標記
研究文檔
關於 Voxtral 研究與開發的詳細技術資訊,可參閱官方研究論文 (arXiv:2507.13264)。
Sources
- OriginalVoxtral
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch