Hugging Face 與 Cerebras 即時語音 AI 使用 Gemma 4
Hugging Face 與 Cerebras 即時語音 AI 使用 Gemma 4
Hugging Face 和 Cerebras 已推出一個即時語音到語音管線,該管線結合開源模型與高速推理,以消除語音 AI 通常相關的延遲瓶頸。透過將 Google DeepMind 的 Gemma 4 31B 與 Cerebras 推理配對,系統達成了自然類人對話所需的響應速度。
開放級聯語音到語音架構
該系統採用模組化、開源的堆疊,其中每個組件都可替換,使開發者能夠為機器人、助理或研究調整管線。完整的語音到語音循環包含以下階段:
- Speech Input: 初始音訊擷取。
- Speech Recognition: 由 Nvidia's Parakeet 提供動力。
- Language Model Inference: Gemma 4 31B 在 Cerebras 硬體上運行。
- Text-to-Speech (TTS): 由 Alibaba's Qwen3TTS 提供動力。
- Spoken Response: 最終音訊輸出。
此模組化方法確保管線的每一層都可以被開發者檢查、修改和擴充。
解決延遲與 P95 穩定性
Cerebras 用於解決語音 AI 中的主要瓶頸:語言模型響應時間。儘管許多生產系統保持可接受的中位延遲,但它們經常在 P95(響應時間的第 95 個百分位數)出現多秒延遲,這會讓互動感覺不可靠。
Cerebras 提供更快且更穩定的推理,減少這些長尾延遲。這種穩定性對於涉及工具調用或多模態步驟且需要多輪對話的複雜互動至關重要。
在具身 AI 與機器人領域的應用
此管線提供的響應速度對具身 AI 至關重要,因為在具身 AI 中,延遲是功能需求而非僅是外觀需求。此特定的語音到語音管線目前驅動 Reachy Mini 機器人,已部署超過 9,000 單位。
根據公告,Cerebras 的整合是由對低延遲和可預測性能的需求所驅動,以確保與機器人和語音助理的互動在規模上感覺自然。
開發者資源
開發者可以透過以下資源存取實作:
- Demo: Hugging Face Space
- Repository: huggingface/speech-to-speech