FlashLabs-AI-Corp/FlashLabs-Chroma

Worlds first open-source real-time end-to-end spoken dialogue model with personalized voice cloning.

解決的問題

Chroma 1.0 的設計旨在實現人與 AI 之間自然、即時的語音對話。它無需獨立的語音轉文字與文字轉語音系統,而是提供一個端對端的多模態模型,能同時理解音訊輸入並生成文字與合成語音回應。

工作原理

Chroma 是一個融合推理器(基於 Qwen2.5-Omni-3B)、主幹網絡(Llama3)與解碼器(Llama3)的多模態因果語言模型,採用 Mimi 編解碼器在 24kHz 采樣率下進行音訊處理。它可直接處理聽覺輸入,並能使用參考音訊提示來引導生成語音的風格,從而實現個人化語音克隆。

適用對象

希望建構虛擬人模型或語音驅動型 AI 代理,且需要低延遲、自然語音互動與個人化語音風格的開發者與研究人員。

主要亮點

  • 端對端語音對話: 單一模型處理音訊輸入並生成音訊/文字輸出。
  • 個人化語音克隆: 使用參考音訊提示模仿特定語音風格。
  • 多模態生成: 同時生成連貫的文字與語音回應。
  • 開源: 以 Apache-2.0 許可證發布,支援社群開發。

相關

  • 專案
  • 專案
  • 專案
  • 專案