FlashLabs-AI-Corp/FlashLabs-Chroma
Worlds first open-source real-time end-to-end spoken dialogue model with personalized voice cloning.
해결하는 문제
Chroma 1.0은 인간과 AI 간에 자연스럽고 실시간 음성 대화를 가능하게 하도록 설계되었습니다. 별도의 음성 인식 및 음성 합성 시스템이 필요 없으며, 음성 입력을 이해하고 동시에 텍스트와 합성 음성을 생성할 수 있는 엔드투엔드 다중 모달 모델을 제공합니다.
작동 방식
Chroma는 추론기(Qwen2.5-Omni-3B 기반), 백본(Llama3), 디코더(Llama3)를 통합한 다중 모달 인과 언어 모델이며, 24kHz 샘플링 속도로 음성 처리에 Mimi 코덱을 사용합니다. 음성 입력을 직접 처리할 수 있으며, 참조 음성 프롬프트를 사용해 생성된 음성의 스타일을 조절할 수 있어, 개인화된 음성 클론이 가능합니다.
대상 사용자
저지연, 자연스러운 음성 상호작용과 개인화된 음성 스타일이 필요한 가상 인간 모델 또는 음성 기반 AI 에이전트를 개발하거나 연구하는 개발자 및 연구자.
주요 특징
- 엔드투엔드 음성 대화: 음성 입력을 처리하고 하나의 모델에서 음성/텍스트 출력을 생성.
- 개인화된 음성 클론: 참조 음성 프롬프트를 사용해 특정 음성 스타일을 모방.
- 다중 모달 생성: 일관된 텍스트와 음성 출력을 동시에 생성.
- 오픈소스: 커뮤니티 개발을 위해 Apache-2.0 라이선스로 공개.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트