nu-dialogue/j-moshi

J-Moshi: A Japanese Full-duplex Spoken Dialogue System

何を解決するか

J-Moshi は日本語向けに設計されたフルデュプレックス音声対話システムです。人間同士の会話に似た自然でリアルタイムの音声インタラクションを実現するための課題に対処しており、リアルタイムでの重なり話や応答語(あいづち)の機能を可能にします。

動作方法

このシステムは Kyutai Labs の 7B パラメータの Moshi モデルに基づいています。大規模な日本語音声対話データを用いた追加学習により開発され、J-CHAT、日本語 Callhome、および内部のチャット・相談対話コーパスなどのコーパスが使用されています。さらに、Multi-stream TTS を用いて生成された合成データを組み込んだ専用バージョンである J-Moshi-ext も存在し、性能を向上させています。

対象ユーザー

日本語音声AI、音声対話システム、自然な人間-コンピュータインタラクション(HCI)に取り組む研究者や開発者。

特徴

  • フルデュプレックス通信: 自然なターンチェンジを伴うリアルタイム双向音声インタラクションを可能にします。
  • 日本語データのキュレーション: 多様な音声およびテキストベースの対話コーパスを用いて学習されています。
  • 2種類のモデルバージョン: 標準版と合成データを用いた拡張版(J-Moshi-ext)の両方を提供します。
  • HuggingFace統合: PyTorch 実装の Moshi を通じて、モデルの容易なデプロイが可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト