xAI Grok Voice Agent API 發佈

xAI 已發佈 Grok Voice Agent API,允許開發者構建具備即時數據搜索、工具調用和多語言通信能力的語音代理。該 API 是基於 Tesla 車輛和 xAI 行動應用程序中所使用的相同技術棧構建的。

高性能音頻推理與延遲

Grok Voice Agent API 旨在追求速度與智能,在 Big Bench Audio 音頻推理基準測試中排名第一。它實現了平均首個音頻生成時間(time-to-first-audio)低於 1 秒,xAI 表示這比其最接近的競爭對手快了近 5 倍。

這種性能是通過完全自主研發的語音技術棧實現的,xAI 從零開始訓練了自己的語音活動檢測(VAD)、分詞器(tokenizer)和音頻模型,以保持對系統智能和速度的細粒度控制。

成本效益與定價模型

Grok Voice Agent API 使用每分鐘音頻時長 0.05 美元的固定費率定價模型。xAI 將其與基於 token 的定價模型進行對比,例如 OpenAI Realtime API,xAI 估計在生產環境中通常超過每分鐘 0.10 美元。

多語言能力與人類評估

Grok Voice Agents 具備數十種語言的原生級熟練度,並可以自動檢測用戶的語言或在對話中途切換語言。開發者也可以通過系統提示詞(system prompts)強制執行特定的響應語言。

在與 OpenAI Realtime API 的盲測對比人類評估中,Grok 在發音、口音和韻律方面被一致評為首選模型。

與 Tesla 的集成與實時工具使用

Tesla 是該 API 的關鍵設計合作夥伴。在 Tesla 車輛中,Grok 與專用工具集成,通過結合 X 搜索數據與路徑計算,來訪問車輛狀態、控制導航並規劃路線。

使用該 API 的開發者可以集成自己的自定義工具,或利用 xAI 在 Web 和 X 上的實時搜索能力,使代理能夠執行任務並並檢索當前信息。

富有表現力的語音選項與聽覺線索

API 提供多種富有表現力的語音,包括 Ara、Eve 和 Leo。這些語音旨在用於自然對話,並能準確發音領域特定術語,例如法律、金融和醫療保健領域。

為了增加真實感,該模型支持開發者可以提示的聽覺線索,例如 [whisper][sigh][laugh]

開發者實現與路線圖

Grok Voice Agent API 與 OpenAI Realtime API 規範兼容,並可通過官方 xAI LiveKit Plugin 獲取。在 xAI Cloud Console 中提供了一個語音遊樂場(voice playground)供瀏覽器端測試。

計劃在未來幾週內發佈的更新包括:

  • 獨立的文本轉語音(TTS)和語音轉文本(STT)端點。
  • 在發音和延遲方面進一步改進的音頻模型。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch