OHF-Voice/wyoming
Peer-to-peer protocol for voice assistants
해결하는 문제
Wyoming은 음성 어시스턴트 구성 요소 간의 통신을 표준화하기 위해 설계된 피어 투 피어 TCP 프로토콜입니다. 특정 소프트웨어 구현에 관계없이 웨이크워드 감지, 음성-텍스트 변환(ASR), 텍스트-음성 변환(TTS), 의도 처리 등의 다양한 서비스가 원활하게 통신할 수 있도록 합니다.
작동 방식
이 프로토콜은 헤더에 JSONL(.JSON Lines)과 페이로드에 원시 PCM 오디오를 사용합니다. 각 메시지는 JSON 객체 헤더, 선택적 추가 데이터, 그리고 바이너리 페이로드로 구성됩니다. 이 구조는 TCP 연결을 통해 오디오 및 제어 이벤트를 효율적으로 스트리밍할 수 있게 합니다.
대상 사용자
주로 Home Assistant를 사용하는 음성 어시스턴트 또는 스마트홈 통합을 개발하는 개발자들을 위한 것입니다. 오디오 하드웨어, 음성 인식 모델, 합성 엔진을 표준화된 방식으로 연결해야 하는 경우에 적합합니다.
주요 특징
- 포괄적인 음성 파이프라인: 웨이크워드 감지, 음성 활동 감지(VAD), 음성-텍스트 변환, 의도 인식, 텍스트-음성 변환을 포함한 완전한 음성 상호작용 루프를 지원합니다.
- 표준화된 이벤트 흐름: 번역 및 합성과 같은 서비스에 대해 명확한 요청-응답 패턴을 정의하며, 스트리밍을 지원합니다.
- 모듈식 아키텍처: Faster Whisper, Piper, openWakeWord 등의 다양한 백엔드 프로젝트를 공통 인터페이스를 통해 사용할 수 있도록 합니다.
- 위성 지원: 원격 음성 위성 관리 및 서버 측 파이프라인 트리거를 위한 특수 이벤트를 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트