kyutai-labs/moshi
Moshi is a speech-text foundation model and full-duplex spoken dialogue framework. It uses Mimi, a state-of-the-art streaming neural audio codec.
解决的问题
Moshi 解决了构建实时双工语音对话系统的挑战。其目标是提供低延迟体验,使 AI 与用户能够同时说话和倾听,避免传统轮次式语音系统中常见的尴尬停顿。
工作原理
Moshi 是一个语音-文本基础模型,能够同时预测两个音频流:一个是 AI 的语音,另一个是用户的语音。为了提高生成质量,它还预测代表自身“内心独白”的文本标记。
该系统依赖于两个主要组件:
- Mimi:一种流式神经音频编解码器,可将 24 kHz 音频压缩为低带宽表示,延迟极低(80ms)。
- Transformers:小型 Depth Transformer 处理跨码本依赖关系,大型 7B 参数 Temporal Transformer 管理时间依赖关系。
适用人群
- 研究人员:对语音-文本基础模型和实时对话感兴趣的人。
- 开发者:希望将低延迟语音 AI 集成到应用中的人,支持 PyTorch(研究)、MLX(macOS/iOS)、Rust(生产)。
- 终端用户:希望通过提供的 Web UI 或 CLI 体验实时自然语音交互的人。
主要亮点
- 双工对话:支持同时说话和倾听。
- 超低延迟:理论延迟为 160ms,L4 GPU 上的实际延迟低至 200ms。
- 多后端支持:支持 PyTorch、MLX(Apple Silicon)、Rust(生产性能)。
- 集成编解码器:内置 Mimi,一种高性能流式神经音频编解码器。
相关
- 项目
- 项目
- 项目
- 项目