kyutai-labs/hibiki

Hibiki is a model for streaming speech translation (also known as simultaneous translation). Unlike offline translation—where one waits for the end of the source utterance to start translating--- Hibiki adapts its flow to accumulate just enough context to produce a correct translation in real-time, chunk by chunk.

解決的問題

Hibiki 提供高保真度的即時同步語音到語音翻譯。與傳統的離線翻譯不同,後者需等待整個語句完成後才開始翻譯,Hibiki 可在使用者說話過程中即時、分塊地進行翻譯。

工作原理

採用多串流架構(源自 Moshi)的僅解碼器模型,聯合建模源語音與目標語音。該模型以恆定的 12.5Hz 速率生成文字與音訊標記,從而實現連續輸出串流。模型使用透過上下文對齊方法生成的合成資料進行訓練,確保目標詞僅在從源端可預測時才出現。

適用對象

對即時音訊翻譯(特別是法語到英語翻譯)感興趣的開發者與研究人員,以及希望在智慧型手機上進行本機部署(透過 Hibiki-M)的使用者。

主要亮點

  • 同步翻譯:在輸入處理過程中即時生成目標語音與文字翻譯。
  • 語音傳遞:可選擇在翻譯輸出中保留原始說話者的語音特徵。
  • 本機運行能力:提供 1B 與 2B 參數版本,其中 1B 模型專為在智慧型手機硬體上本機執行而設計。
  • 跨平台支援:提供 PyTorch、Rust、MLX(macOS)與 MLX-Swift(iOS)的推論程式碼。

相關

  • 專案
  • 專案
  • 專案
  • 專案