kyutai-labs/hibiki

Hibiki is a model for streaming speech translation (also known as simultaneous translation). Unlike offline translation—where one waits for the end of the source utterance to start translating--- Hibiki adapts its flow to accumulate just enough context to produce a correct translation in real-time, chunk by chunk.

何を解決するか

Hibikiは高精細な同時音声-to音声翻訳を提供します。従来のオフライン翻訳とは異なり、完全な発話が終了するまで待つ必要がなく、ユーザーが話す途中でもリアルタイムでチャンク単位で翻訳が行われます。

動作方法

マルチストリームアーキテクチャ(Moshiから継承)を備えたデコーダー専用モデルを使用し、入力音声と出力音声を同時にモデル化します。モデルは12.5Hzの一定レートでテキストと音声トークンを生成し、継続的な出力ストリームを可能にします。合成データは、ターゲット語がソースから予測可能になった時点でのみ出現するよう保証する文脈的アライメント手法で生成されました。

対象ユーザー

リアルタイム音声翻訳(特にフランス語→英語翻訳)に興味がある開発者や研究者、スマートフォン上でオンデバイス実行を希望するユーザー(Hibiki-M経由)。

特徴

  • 同時翻訳: 入力が処理される途中で、ターゲット音声とテキスト翻訳をリアルタイムで生成。
  • ボイス転送: オプションで、翻訳出力に元の話者の声の特徴を維持。
  • オンデバイス対応: 1Bおよび2Bパラメータバージョンを提供。1Bモデルはスマートフォンのハードウェア上でローカル実行を想定。
  • クロスプラットフォーム対応: PyTorch、Rust、MLX(macOS)、MLX-Swift(iOS)用の推論コードを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト