xAI Grok Voice Agent API 发布
xAI 发布了 Grok Voice Agent API,允许开发者构建具备实时数据搜索、工具调用和多语言通信能力的语音智能体。该 API 基于 Tesla 车辆和 xAI 移动应用程序所使用的相同技术栈构建。
高性能音频推理与低延迟
Grok Voice Agent API 旨在实现速度与智能,在 Big Bench Audio 音频推理基准测试中排名第一。它实现了平均首个音频时间(time-to-first-audio)小于 1 秒,xAI 表示这比其最接近的竞争对手快了近 5 倍。
这种性能是通过完全自主研发的语音技术栈实现的,xAI 从零开始训练了自己的语音活动检测(VAD)、分词器(tokenizer)和音频模型,以保持对系统智能度和速度的细粒度控制。
成本效益与定价模型
Grok Voice Agent API 使用每分钟音频时长 0.05 美元的固定费率定价模型。xAI 将其与基于 token 的定价模型进行对比,例如 OpenAI Realtime API,xAI 估计后者在生产环境中的成本通常超过每分钟 0.10 美元。
多语言能力与人工评估
Grok Voice Agents 具备数十种语言的原生级熟练度,并能自动检测用户语言或在对话中途切换语言。开发者也可以通过系统提示词(system prompts)强制执行特定的响应语言。
在针对 OpenAI Realtime API 的盲测人工对比评估中,Grok 在发音、口音和韵律方面被一致评为首选模型。
与 Tesla 的集成与实时工具使用
Tesla 是该 API 的关键设计合作伙伴。在 Tesla 车辆中,Grok 与专门的工具集成,通过结合 X 搜索数据与路径计算,访问车辆状态、控制导航并规划路线。
使用该 API 的开发者可以集成自己的自定义工具,或利用 xAI 在 Web 和 X 上的实时搜索能力,使智能体能够执行任务并检索当前信息。
表现力丰富的语音选项与听觉线索
该 API 提供多种具有表现力的语音,包括 Ara、Eve 和 Leo。这些语音旨在用于自然对话,并能准确发音领域特定术语,如法律、金融和医疗保健领域。
为了增加真实感,该模型支持开发者可以提示的听觉线索,例如 [whisper], [sigh], 和 [laugh]。
开发者实现与路线图
Grok Voice Agent API 与 OpenAI Realtime API 规范兼容,并可通过官方 xAI LiveKit Plugin 获取。xAI Cloud Console 中提供了一个语音游乐场(voice playground)供浏览器端测试。
计划在未来几周内发布的后续版本包括:
- 独立的文本转语音 (TTS) 和语音转文本 (STT) 端点。
- 在发音和延迟方面进一步改进的音频模型。
Sources
- OriginalGrok Voice Agent API
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch