nu-dialogue/j-moshi

J-Moshi: A Japanese Full-duplex Spoken Dialogue System

解決的問題

J-Moshi 是一個專為日語設計的全雙工語音對話系統。它解決了創造自然、即時語音互動的挑戰,模擬人與人之間的對話,特別支援即時重疊說話與回應語(あいづち)。

工作原理

該系統基於 Kyutai Labs 的 7B 參數 Moshi 模型。透過在大規模日語語音對話資料上進行額外訓練開發而成,包括 J-CHAT、日語 Callhome 以及內部聊天與諮詢對話語料庫。一個專門版本 J-Moshi-ext 更進一步結合了透過多串流 TTS 生成的合成資料,以提升效能。

適用對象

從事日語語音 AI、語音對話系統與自然人機互動(HCI)的研究人員與開發者。

主要亮點

  • 全雙工通訊:支援自然的雙向即時語音互動,具備自然的輪替發言機制。
  • 日語資料精選:基於多樣化的語音與文字對話語料庫進行訓練。
  • 兩種模型變體:提供標準版本與使用合成資料的擴展版本(J-Moshi-ext)。
  • HuggingFace 集成:可透過 Moshi 的 PyTorch 實作輕鬆部署模型。

相關

  • 專案
  • 專案
  • 專案
  • 專案