nu-dialogue/j-moshi
J-Moshi: A Japanese Full-duplex Spoken Dialogue System
해결하는 문제
J-Moshi는 일본어를 위한 풀디플렉스 음성 대화 시스템입니다. 인간 간 대화를 모방하는 자연스럽고 실시간 음성 상호작용을 구현하기 위한 도전 과제를 해결하며, 실시간으로 말의 겹침과 응답 말(아이즈치) 기능을 가능하게 합니다.
작동 방식
이 시스템은 Kyutai Labs의 7B 파라미터 Moshi 모델을 기반으로 합니다. J-CHAT, 일본어 Callhome, 그리고 내부 채팅 및 상담 대화 코퍼스를 포함한 대규모 일본어 음성 대화 데이터를 활용해 추가 학습되었습니다. 특화된 버전인 J-Moshi-ext는 다중 스트림 TTS를 통해 생성된 합성 데이터를 추가로 활용하여 성능을 향상시켰습니다.
대상 사용자
일본어 음성 AI, 음성 대화 시스템, 자연스러운 인간-컴퓨터 상호작용(HCI) 개발에 종사하는 연구자 및 개발자.
주요 특징
- 풀디플렉스 통신: 자연스러운 턴 전환을 지원하는 실시간 양방향 음성 상호작용을 가능하게 합니다.
- 일본어 데이터 컬렉션: 다양한 음성 및 텍스트 기반 대화 코퍼스를 기반으로 학습되었습니다.
- 두 가지 모델 버전: 표준 버전과 합성 데이터를 사용한 확장 버전(J-Moshi-ext)을 제공합니다.
- HuggingFace 통합: Moshi의 PyTorch 구현을 통해 모델을 쉽게 배포할 수 있습니다.
관련
- 프로젝트
flyteorg/flytekitFlytekit Python은 `@task` 및 `@workflow` 데코레이터를 사용하여 순수한 Python으로 AI/ML 워크플로우를 작성, 테스트, 배포할 수 있는 Flyte의 공식 SDK입니다. `pip install flytekit`로 설치하고, 빠른 시작 가이드를 따르며, 플러그인을 통해 확장하거나 제공된 문서를 통해 기여할 수 있습니다.
- 프로젝트
aa0101181514/tw-legal-ragtw-legal-rag는 2,200만 건 이상의 대만 판례, 법률, 행정 결정을 포함하는 호스팅된 의미 기반 검색 서비스에 연결하는 오픈소스 Python CLI입니다. 자연어 검색, 정확한 사건 번호 조회, 결과(요약, 판례 이력, 인용 허용 목록 포함)를 JSON 파일로 번들링, LLM 생성 답변에 대한 결정론적 인용 검증이 가능합니다. 도구 자체는 LLM을 호출하지 않으며 API 키도 필요 없으며, 법적 AI 애플리케이션을 위한 검색 증강 생성(RAG) 프론트엔드로 작동합니다.
- 프로젝트
OpenVoiceOS/ovos-installerOpen Voice OS를 위한 간소화된 설치 프로그램으로, 사용자가 Raspberry Pi, Linux 또는 Mac 하드웨어에서 프라이버시 중심의 오픈소스 음성 비서를 배포할 수 있도록 합니다.
- 프로젝트
csyangwen/dsh-memory-evolvedsh‑memory‑evolve 는 AI에게 지속적인 크로스세션 메모리, 할 일/프로젝트 로그, Git 기반 메모리 동기화, 다중 에이전트 오케스트레이션(내부 하위 세션 및 외부 AI 제공자), 파일용 검색 가능한 무한 캔버스, 선택적 리뷰 세션, 모바일 친화적 UI와 알림을 제공하는 DSH 플러그인입니다. AI가 장기적인 파트너이자 팀 조율자로 기능하게 하면서도, 모든 쓰기 작업을 사용자가 제어할 수 있도록 합니다.