허깅 페이스와 세레브라스 실시간 음성 AI with Gemma 4
허깅 페이스와 세레브라스 실시간 음성 AI with Gemma 4
오픈 캐스케이디드 음성-음성 아키텍처
이 시스템은 각 구성 요소를 교체할 수 있는 모듈형 오픈소스 스택을 활용하여, 개발자가 로봇, 어시스턴트 또는 연구를 위해 파이프라인을 조정할 수 있도록 합니다. 전체 음성-음성 루프는 다음과 같은 단계로 구성됩니다:
- Speech Input: 초기 오디오 캡처.
- Speech Recognition: Nvidia의 Parakeet로 구동됨.
- Language Model Inference: Cerebras 하드웨어에서 실행되는 Gemma 4 31B.
- Text-to-Speech (TTS): Alibaba의 Qwen3TTS로 구동됨.
- Spoken Response: 최종 오디오 출력.
이 모듈식 접근 방식은 파이프라인의 모든 계층을 개발자가 검사, 수정, 확장할 수 있도록 보장합니다.
지연 시간과 P95 안정성 해결
Cerebras는 음성 AI의 주요 병목 현상인 언어 모델 응답 시간을 해결하는 데 사용됩니다. 많은 프로덕션 시스템이 허용 가능한 중간 지연 시간을 유지하지만, P95(응답 시간의 95번째 백분위수)에서 다초초 지연이 자주 발생하여 상호작용이 신뢰할 수 없게 느껴집니다.
Cerebras는 더 빠르고 안정적인 추론을 제공하여 이러한 긴 꼬리 지연을 줄입니다. 이 안정성은 도구 호출이나 multimodal 단계와 같은 복잡한 상호작용에 필수적이며, 여러 차례의 대화가 필요합니다.
구현형 AI 및 로봇에서의 응용
이 파이프라인이 제공하는 응답성은 구현형 AI에 필수적이며, 여기서 지연 시간은 미적인 요소가 아닌 기능적 요구 사항입니다. 이 특정 음성-음성 파이프라인은 현재 Reachy Mini 로봇을 구동하며, 9,000대 이상이 배포되었습니다.
발표에 따르면, Cerebras 통합은 로봇 및 음성 어시스턴트와의 상호작용이 규모에 관계없이 자연스럽게 느껴지도록 낮은 지연 시간과 예측 가능한 성능이 필요하기 때문에 추진됩니다.
개발자 리소스
개발자는 다음 리소스를 통해 구현에 접근할 수 있습니다: