kyutai-labs/hibiki
Hibiki is a model for streaming speech translation (also known as simultaneous translation). Unlike offline translation—where one waits for the end of the source utterance to start translating--- Hibiki adapts its flow to accumulate just enough context to produce a correct translation in real-time, chunk by chunk.
解决的问题
Hibiki 提供高保真度的实时同步语音到语音翻译。与传统的离线翻译不同,后者需要等待整个语句完成后才开始翻译,Hibiki 在用户说话过程中即可实时、分块地进行翻译。
工作原理
采用基于多流架构(源自 Moshi)的仅解码器模型,联合建模源语音和目标语音。该模型以恒定的 12.5Hz 速率生成文本和音频标记,从而实现连续输出流。模型使用通过上下文对齐方法生成的合成数据进行训练,确保目标词仅在从源端可预测时才出现。
适用人群
对实时音频翻译(特别是法语到英语翻译)感兴趣的开发者和研究人员,以及希望在智能手机上进行本地部署(通过 Hibiki-M)的用户。
主要亮点
- 同步翻译:在输入处理过程中实时生成目标语音和文本翻译。
- 语音迁移:可选择在翻译输出中保留原始说话者的语音特征。
- 本地运行能力:提供 1B 和 2B 参数版本,其中 1B 模型专为在智能手机硬件上本地执行而设计。
- 跨平台支持:提供 PyTorch、Rust、MLX(macOS)和 MLX-Swift(iOS)的推理代码。
相关
- 项目
- 项目
- 项目
- 项目