FlashLabs-AI-Corp/FlashLabs-Chroma

Worlds first open-source real-time end-to-end spoken dialogue model with personalized voice cloning.

解决的问题

Chroma 1.0 的设计旨在实现人与 AI 之间的自然、实时语音对话。它无需独立的语音识别和语音合成系统,而是提供一个端到端的多模态模型,能够同时理解音频输入并生成文本和合成语音响应。

工作原理

Chroma 是一个融合推理器(基于 Qwen2.5-Omni-3B)、主干网络(Llama3)和解码器(Llama3)的多模态因果语言模型,采用 Mimi 编解码器在 24kHz 采样率下进行音频处理。它可直接处理听觉输入,并能使用参考音频提示来引导生成语音的风格,从而实现个性化语音克隆。

适用人群

希望构建虚拟人模型或语音驱动型 AI 代理,且需要低延迟、自然语音交互和个性化语音风格的开发者与研究人员。

主要亮点

  • 端到端语音对话: 单一模型处理音频输入并生成音频/文本输出。
  • 个性化语音克隆: 使用参考音频提示模仿特定语音风格。
  • 多模态生成: 同时生成连贯的文本和语音响应。
  • 开源: 采用 Apache-2.0 许可证发布,支持社区开发。

相关

  • 项目
  • 项目
  • 项目
  • 项目