FlashLabs-AI-Corp/FlashLabs-Chroma
Worlds first open-source real-time end-to-end spoken dialogue model with personalized voice cloning.
解決的問題
Chroma 1.0 的設計旨在實現人與 AI 之間自然、即時的語音對話。它無需獨立的語音轉文字與文字轉語音系統,而是提供一個端對端的多模態模型,能同時理解音訊輸入並生成文字與合成語音回應。
工作原理
Chroma 是一個融合推理器(基於 Qwen2.5-Omni-3B)、主幹網絡(Llama3)與解碼器(Llama3)的多模態因果語言模型,採用 Mimi 編解碼器在 24kHz 采樣率下進行音訊處理。它可直接處理聽覺輸入,並能使用參考音訊提示來引導生成語音的風格,從而實現個人化語音克隆。
適用對象
希望建構虛擬人模型或語音驅動型 AI 代理,且需要低延遲、自然語音互動與個人化語音風格的開發者與研究人員。
主要亮點
- 端對端語音對話: 單一模型處理音訊輸入並生成音訊/文字輸出。
- 個人化語音克隆: 使用參考音訊提示模仿特定語音風格。
- 多模態生成: 同時生成連貫的文字與語音回應。
- 開源: 以 Apache-2.0 許可證發布,支援社群開發。
相關
- 專案
- 專案
- 專案
- 專案