kyutai-labs/moshi

Moshi is a speech-text foundation model and full-duplex spoken dialogue framework. It uses Mimi, a state-of-the-art streaming neural audio codec.

何を解決するか

Moshiは、リアルタイムで双方向音声対話システムを構築する課題に対処します。AIとユーザーが同時に話したり聞きたりできる低遅延体験を提供することを目指しており、従来のターンベース音声システムで見られる不自然な待機時間を回避します。

動作方法

Moshiは、AIの発話とユーザーの発話の2つの同時音声ストリームを予測する音声-テキスト基盤モデルです。生成品質を向上させるために、自身の「内面的独り言」を表すテキストトークンも予測します。

このシステムは2つの主要なコンポーネントに依存しています:

  • Mimi:24 kHz音声を非常に低遅延(80ms)で低帯域幅表現に圧縮するストリーミング神経音声コーデック。
  • Transformers:小規模なDepth Transformerがコードブック間の依存関係を処理し、大規模な7BパラメータのTemporal Transformerが時間的依存関係を管理します。

対象ユーザー

  • 研究者:音声-テキスト基盤モデルおよびリアルタイム対話に興味がある人。
  • 開発者:低遅延音声AIをアプリケーションに統合したい人。PyTorch(研究用)、MLX(macOS/iOS用)、Rust(本番環境用)をサポート。
  • エンドユーザー:提供されたWeb UIまたはCLIを通じて、リアルタイムで自然な音声インタラクションを体験したい人。

特徴

  • 双方向対話:同時発話と受話をサポート。
  • 超低遅延:理論上の遅延は160ms、L4 GPUでは実際の遅延が200msまで。
  • マルチバックエンド対応:PyTorch、MLX(Apple Silicon用)、Rust(本番パフォーマンス用)で利用可能。
  • 統合コーデック:高性能なストリーミング神経音声コーデックであるMimiを内蔵。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト