kyutai-labs/hibiki
Hibiki is a model for streaming speech translation (also known as simultaneous translation). Unlike offline translation—where one waits for the end of the source utterance to start translating--- Hibiki adapts its flow to accumulate just enough context to produce a correct translation in real-time, chunk by chunk.
해결하는 문제
Hibiki는 고해상도의 동시에 음성-to-음성 번역을 제공합니다. 기존의 오프라인 번역과 달리, 전체 발화가 끝나기 전까지 기다릴 필요 없이 사용자가 말하는 동안 실시간으로 청크 단위로 번역이 이루어집니다.
작동 방식
Moshi에서 계승한 멀티스트림 아키텍처를 가진 디코더 전용 모델을 사용하여 소스 음성과 타겟 음성을 동시에 모델링합니다. 모델은 12.5Hz의 일정한 속도로 텍스트와 오디오 토큰을 생성하여 지속적인 출력 스트림을 가능하게 합니다. 타겟 단어는 소스에서 예측 가능한 시점에만 나타나도록 보장하는 문맥적 정렬 방법을 통해 생성된 합성 데이터로 훈련되었습니다.
대상 사용자
실시간 오디오 번역(특히 프랑스어→영어 번역)에 관심이 있는 개발자 및 연구자, 그리고 스마트폰에서 온디바이스 배포를 원하는 사용자(또는 Hibiki-M를 통해).
주요 특징
- 동시 번역: 입력이 처리되는 도중 타겟 음성과 텍스트 번역을 실시간으로 생성.
- 음성 전송: 선택적으로 원본 화자의 음성 특성을 번역된 출력에 유지.
- 온디바이스 가능: 1B 및 2B 파라미터 버전 제공. 1B 모델은 스마트폰 하드웨어에서 로컬 실행을 위해 설계됨.
- 크로스플랫폼 지원: PyTorch, Rust, MLX (macOS), MLX-Swift (iOS)용 추론 코드 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트