Mistral AI Voxtral TTS 發佈
Mistral AI 已推出 Voxtral TTS,這是一個擁有 4B 參數的文字轉語音 (TTS) 模型,旨在提供高保真、多語言的語音生成。該模型經過工程設計,可提供具備低延遲且真實、富有情感表現力的語音,使其適用於可擴展的企業級語音代理和即時互動。
高自然度多語言語音生成
Voxtral TTS 在九種語言中展現了尖端的性能:英語、法語、德語、西班牙語、荷蘭語、葡萄牙語、義大利語、印地語和阿拉伯語。該模型專注於真實性,透過捕捉文化細微差別、自然節奏和情感靈活性,包括解讀上下文(例如諷刺或快樂)的能力,以避免機械式的表達。
語音模擬與適應
Voxtral TTS 可以使用長度僅為 3 秒的參考樣本來適應自定義語音。這種適應不僅捕捉說話者的聲音,還捕捉特定的細微差別,例如:
- 微妙的口音
- 語調與抑揚頓挫
- 參考音訊中存在的語言不流暢性
值得注意的是,該模型展示了零樣本跨語言語音適應能力。它可以在一種語言中生成語音,同時採用另一種語言提供的語音提示的口音(例如,使用法語語音提示生成帶有自然法語口音的英語語音)。
性能基準測試與人工評估
由於字錯誤率 (word-error-rate) 等自動化指標無法完全捕捉語音的自然度,Mistral AI 利用了母語人士進行的比較性人工評估。
- 自然度: 人工評估顯示,Voxtral TTS 在保持與 ElevenLabs Flash v2.5 相似的首個音訊時間 (TTFA) 的同時,達到了比 ElevenLabs Flash v2.5 更優越的自然度。
- 品質: 該模型在支持用於栩栩如生的互動的情感引導方面,表現與 ElevenLabs v3 持平。
- 零樣本自定義語音: 在涵蓋九種支持語言的並排偏好測試中,Voxtral TTS 在零樣本多語言自定義語音設置下,展現出比 ElevenLabs v2.5 Flash 更大的品質差距。
技術架構
Voxtral TTS 是一個基於 Transformer 的自回歸流匹配 (flow-matching) 模型,建立在 Ministral 3B 骨幹網路之上。該架構由三個主要組件組成:
- Transformer Decoder Backbone: 3.4B 參數。
- Flow-Matching Acoustic Transformer: 390M 參數。
- Neural Audio Codec: 300M 參數(對稱式編碼器-解碼器)。
處理流程: 該模型接受一個語音提示(5 到 25 秒)和一個文字提示。Transformer 骨幹網路會預測每個音訊幀的語義標記 (semantic token);接著,flow-matching Transformer 會執行 16 次函數評估 (NFEs) 以產生聲學潛在向量 (acoustic latent)。內部的 codec 透過語義 VQ (8192 vocabulary) 和聲學 FSQ (36 dim and 21 levels) 潛在向量,以 12.5Hz 的幀率進行因果式音訊處理。
延遲與串流能力
Voxtral TTS 專為即時語音代理應用而設計,針對低延遲串流進行了優化:
- 模型延遲: 對於典型的 500 字元輸入(10 秒音訊),延遲為 70ms。
- 即時因子 (RTF): 約 9.7x。
- 生成長度: 該模型原生支持生成長達兩分鐘的音訊,API 則透過智能交錯技術支持更長的生成。
企業級集成與可用性
Voxtral TTS 定位於為企業級語音流水線提供輸出層,能夠與 Voxtral Transcribe 集成,以實現完整的語音轉語音工作流,或與現有的語音轉文字和 LLM 技術棧進行集成。
訪問與定價:
- API 訪問: 價格為每 1k 字元 0.016 美元。
- 測試: 可在 Mistral Studio 和 Le Chat 中使用。
- 開源權重: 包含多種參考語音的版本已根據 CC BY NC 4.0 許可證在 Hugging Face 上提供。
Sources
- OriginalSpeaking of Voxtral
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch