Hugging Face 和 Cerebras 使用 Gemma 4 的实时语音 AI
Hugging Face 和 Cerebras 使用 Gemma 4 的实时语音 AI
Hugging Face 和 Cerebras 已经推出一个实时语音到语音管道,将开源模型与高速推理相结合,以消除通常与语音 AI 相关的延迟瓶颈。通过将 Google DeepMind 的 Gemma 4 31B 与 Cerebras 推理配对,该系统实现了自然人类对话所需的响应速度。
开放级联语音到语音架构
系统采用模块化、开源的堆栈,每个组件都可替换,使开发者能够将管道适应机器人、助手或研究。完整的语音到语音循环由以下阶段组成:
- 语音输入: 初始音频捕获。
- 语音识别: 由 Nvidia 的 Parakeet 提供支持。
- 语言模型推理: Gemma 4 31B 在 Cerebras 硬件上运行。
- 文本到语音 (TTS): 由 Alibaba 的 Qwen3TTS 提供支持。
- 口头响应: 最终音频输出。
这种模块化方法确保管道的每一层都可以被开发者检查、修改和扩展。
解决延迟和 P95 稳定性
Cerebras 用于解决语音 AI 中的主要瓶颈:语言模型响应时间。虽然许多生产系统保持可接受的中位延迟,但它们在 P95(响应时间的第 95 百分位数)上经常出现多秒延迟,这会导致交互感觉不可靠。
Cerebras 提供更快且更稳定的推理,减少这些长尾延迟。这种稳定性对于涉及工具调用或多模态步骤的复杂交互至关重要,因为这些交互需要多轮对话。
在具身 AI 和机器人中的应用
此管道提供的响应速度对具身 AI 至关重要,因为在具身 AI 中,延迟是功能需求而非仅仅是外观需求。此特定的语音到语音管道目前为 Reachy Mini 机器人提供动力,已部署超过 9,000 台单元。
根据公告,Cerebras 的集成是由对低延迟和可预测性能的需求驱动的,以确保与机器人和语音助手的交互在规模上感觉自然。
开发者资源
开发者可以通过以下资源访问实现: