FlashLabs-AI-Corp/FlashLabs-Chroma

Worlds first open-source real-time end-to-end spoken dialogue model with personalized voice cloning.

何を解決するか

Chroma 1.0 は、人間と AI の間で自然でリアルタイムの音声対話を行うことを可能にするように設計されています。音声認識と音声合成の別々のシステムを必要とせず、音声入力を理解し、テキストと合成音声の両方を同時に生成できるエンドツーエンドのマルチモーダルモデルを提供します。

動作方法

Chroma は、推論器(Qwen2.5-Omni-3B をベース)、バックボーン(Llama3)、デコーダー(Llama3)を統合したマルチモーダル因果言語モデルであり、24kHz のサンプリングレートで音声処理に Mimi コーデックを使用しています。音声入力を直接処理でき、参照音声プロンプトを使って生成音声のスタイルを制御できるため、パーソナライズされた音声クローンが可能になります。

対象ユーザー

低遅延で自然な音声対話とパーソナライズされた音声スタイルを必要とする、仮想人間モデルや音声駆動型 AI エージェントの開発・研究に取り組む開発者や研究者。

特徴

  • エンドツーエンド音声対話: 音声入力を処理し、1 つのモデルで音声/テキスト出力を生成。
  • パーソナライズされた音声クローン: 参照音声プロンプトを使用して特定の声のスタイルを模倣。
  • マルチモーダル生成: 一貫性のあるテキストと音声の両方を同時に生成。
  • オープンソース: コミュニティ開発を促進するため Apache-2.0 ライセンスで公開。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト