nu-dialogue/j-moshi

J-Moshi: A Japanese Full-duplex Spoken Dialogue System

解决的问题

J-Moshi 是一个专为日语设计的全双工语音对话系统。它解决了创建自然、实时语音交互的挑战,模拟人与人之间的对话,特别支持实时重叠说话和回应性话语(あいづち)。

工作原理

该系统基于 Kyutai Labs 的 7B 参数 Moshi 模型。通过在大规模日语语音对话数据上进行额外训练开发而成,包括 J-CHAT、日本语 Callhome 以及内部聊天和咨询对话语料库。一个专门版本 J-Moshi-ext 进一步结合了通过多流 TTS 生成的合成数据,以提升性能。

适用人群

从事日语语音 AI、语音对话系统和自然人机交互(HCI)的研究人员和开发者。

主要亮点

  • 全双工通信:支持自然的双向实时语音交互,具备自然的轮换发言机制。
  • 日语数据精选:基于多样化的语音和文本对话语料库进行训练。
  • 两种模型变体:提供标准版本和使用合成数据的扩展版本(J-Moshi-ext)。
  • HuggingFace 集成:可通过 Moshi 的 PyTorch 实现轻松部署模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目