nu-dialogue/j-moshi

J-Moshi: A Japanese Full-duplex Spoken Dialogue System

해결하는 문제

J-Moshi는 일본어를 위한 풀디플렉스 음성 대화 시스템입니다. 인간 간 대화를 모방하는 자연스럽고 실시간 음성 상호작용을 구현하기 위한 도전 과제를 해결하며, 실시간으로 말의 겹침과 응답 말(아이즈치) 기능을 가능하게 합니다.

작동 방식

이 시스템은 Kyutai Labs의 7B 파라미터 Moshi 모델을 기반으로 합니다. J-CHAT, 일본어 Callhome, 그리고 내부 채팅 및 상담 대화 코퍼스를 포함한 대규모 일본어 음성 대화 데이터를 활용해 추가 학습되었습니다. 특화된 버전인 J-Moshi-ext는 다중 스트림 TTS를 통해 생성된 합성 데이터를 추가로 활용하여 성능을 향상시켰습니다.

대상 사용자

일본어 음성 AI, 음성 대화 시스템, 자연스러운 인간-컴퓨터 상호작용(HCI) 개발에 종사하는 연구자 및 개발자.

주요 특징

  • 풀디플렉스 통신: 자연스러운 턴 전환을 지원하는 실시간 양방향 음성 상호작용을 가능하게 합니다.
  • 일본어 데이터 컬렉션: 다양한 음성 및 텍스트 기반 대화 코퍼스를 기반으로 학습되었습니다.
  • 두 가지 모델 버전: 표준 버전과 합성 데이터를 사용한 확장 버전(J-Moshi-ext)을 제공합니다.
  • HuggingFace 통합: Moshi의 PyTorch 구현을 통해 모델을 쉽게 배포할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트