kyutai-labs/moshi
Moshi is a speech-text foundation model and full-duplex spoken dialogue framework. It uses Mimi, a state-of-the-art streaming neural audio codec.
해결하는 문제
Moshi는 실시간 양방향 음성 대화 시스템을 구축하는 도전 과제를 해결합니다. AI와 사용자가 동시에 말하고 듣는 저지연 경험을 제공하여, 기존의 턴기반 음성 시스템에서 흔히 발생하는 어색한 정지 시간을 피하고자 합니다.
작동 방식
Moshi는 AI의 발화와 사용자의 발화를 동시에 예측하는 음성-텍스트 기반 모델입니다. 생성 품질을 향상시키기 위해, 자신의 '내면적 독백'을 나타내는 텍스트 토큰도 예측합니다.
이 시스템은 두 가지 주요 구성 요소에 의존합니다:
- Mimi: 24kHz 음성을 매우 낮은 지연(80ms)으로 저대역폭 표현으로 압축하는 스트리밍 신경 음성 코덱입니다.
- Transformers: 작은 Depth Transformer는 코드북 간 종속성을 처리하고, 큰 7B 파라미터 Temporal Transformer는 시간적 종속성을 관리합니다.
대상 사용자
- 연구자: 음성-텍스트 기반 모델과 실시간 대화에 관심 있는 사람.
- 개발자: 저지연 음성 AI를 애플리케이션에 통합하고자 하는 사람. PyTorch(연구용), MLX(macOS/iOS용), Rust(생산용) 지원.
- 최종 사용자: 제공된 웹 UI 또는 CLI를 통해 실시간 자연스러운 음성 상호작용을 경험하고자 하는 사람.
주요 특징
- 양방향 대화: 동시에 말하고 듣는 것을 지원합니다.
- 초저지연: 이론적 지연은 160ms이며, L4 GPU에서는 실질적으로 200ms까지 가능합니다.
- 다중 백엔드 지원: PyTorch, MLX(Apple Silicon용), Rust(생산 성능용)에서 사용 가능합니다.
- 통합 코덱: 고성능 스트리밍 신경 음성 코덱인 Mimi를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트