kyutai-labs/moshi

Moshi is a speech-text foundation model and full-duplex spoken dialogue framework. It uses Mimi, a state-of-the-art streaming neural audio codec.

解決的問題

Moshi 解決了建立即時雙工語音對話系統的挑戰。其目標是提供低延遲體驗,讓 AI 與使用者能同時說話與聆聽,避免傳統輪替式語音系統常見的尷尬停頓。

工作原理

Moshi 是一個語音-文字基礎模型,能夠同時預測兩個音訊串流:一個是 AI 的語音,另一個是使用者的語音。為了提升生成品質,它還預測代表自身「內心獨白」的文本標記。

該系統依賴於兩個主要組件:

  • Mimi:一種串流神經音訊編解碼器,可將 24 kHz 音訊壓縮為低頻寬表示,延遲極低(80ms)。
  • Transformers:小型 Depth Transformer 處理跨碼本依賴關係,大型 7B 參數 Temporal Transformer 管理時間依賴關係。

適用對象

  • 研究人員:對語音-文字基礎模型與即時對話感興趣的人。
  • 開發者:希望將低延遲語音 AI 集成到應用中的人,支援 PyTorch(研究)、MLX(macOS/iOS)、Rust(生產)。
  • 終端使用者:希望透過提供的 Web UI 或 CLI 體驗即時自然語音互動的人。

主要亮點

  • 雙工對話:支援同時說話與聆聽。
  • 超低延遲:理論延遲為 160ms,L4 GPU 上的實際延遲低至 200ms。
  • 多後端支援:支援 PyTorch、MLX(Apple Silicon)、Rust(生產效能)。
  • 整合編解碼器:內建 Mimi,一種高效率的串流神經音訊編解碼器。

相關

  • 專案
  • 專案
  • 專案
  • 專案