kyutai-labs/moshi

Moshi is a speech-text foundation model and full-duplex spoken dialogue framework. It uses Mimi, a state-of-the-art streaming neural audio codec.

解决的问题

Moshi 解决了构建实时双工语音对话系统的挑战。其目标是提供低延迟体验,使 AI 与用户能够同时说话和倾听,避免传统轮次式语音系统中常见的尴尬停顿。

工作原理

Moshi 是一个语音-文本基础模型,能够同时预测两个音频流:一个是 AI 的语音,另一个是用户的语音。为了提高生成质量,它还预测代表自身“内心独白”的文本标记。

该系统依赖于两个主要组件:

  • Mimi:一种流式神经音频编解码器,可将 24 kHz 音频压缩为低带宽表示,延迟极低(80ms)。
  • Transformers:小型 Depth Transformer 处理跨码本依赖关系,大型 7B 参数 Temporal Transformer 管理时间依赖关系。

适用人群

  • 研究人员:对语音-文本基础模型和实时对话感兴趣的人。
  • 开发者:希望将低延迟语音 AI 集成到应用中的人,支持 PyTorch(研究)、MLX(macOS/iOS)、Rust(生产)。
  • 终端用户:希望通过提供的 Web UI 或 CLI 体验实时自然语音交互的人。

主要亮点

  • 双工对话:支持同时说话和倾听。
  • 超低延迟:理论延迟为 160ms,L4 GPU 上的实际延迟低至 200ms。
  • 多后端支持:支持 PyTorch、MLX(Apple Silicon)、Rust(生产性能)。
  • 集成编解码器:内置 Mimi,一种高性能流式神经音频编解码器。

相关

  • 项目
  • 项目
  • 项目
  • 项目