kyutai-labs/moshi
Moshi is a speech-text foundation model and full-duplex spoken dialogue framework. It uses Mimi, a state-of-the-art streaming neural audio codec.
解決的問題
Moshi 解決了建立即時雙工語音對話系統的挑戰。其目標是提供低延遲體驗,讓 AI 與使用者能同時說話與聆聽,避免傳統輪替式語音系統常見的尷尬停頓。
工作原理
Moshi 是一個語音-文字基礎模型,能夠同時預測兩個音訊串流:一個是 AI 的語音,另一個是使用者的語音。為了提升生成品質,它還預測代表自身「內心獨白」的文本標記。
該系統依賴於兩個主要組件:
- Mimi:一種串流神經音訊編解碼器,可將 24 kHz 音訊壓縮為低頻寬表示,延遲極低(80ms)。
- Transformers:小型 Depth Transformer 處理跨碼本依賴關係,大型 7B 參數 Temporal Transformer 管理時間依賴關係。
適用對象
- 研究人員:對語音-文字基礎模型與即時對話感興趣的人。
- 開發者:希望將低延遲語音 AI 集成到應用中的人,支援 PyTorch(研究)、MLX(macOS/iOS)、Rust(生產)。
- 終端使用者:希望透過提供的 Web UI 或 CLI 體驗即時自然語音互動的人。
主要亮點
- 雙工對話:支援同時說話與聆聽。
- 超低延遲:理論延遲為 160ms,L4 GPU 上的實際延遲低至 200ms。
- 多後端支援:支援 PyTorch、MLX(Apple Silicon)、Rust(生產效能)。
- 整合編解碼器:內建 Mimi,一種高效率的串流神經音訊編解碼器。
相關
- 專案
- 專案
- 專案
- 專案