OHF-Voice/wyoming-faster-whisper

Wyoming protocol server for faster whisper speech to text system

해결하는 문제

이 프로젝트는 faster-whisper 시스템을 사용하여 음성 인식(STT) 기능을 가능하게 하는 Wyoming 프로토콜을 구현한 서버를 제공합니다. 특히 사용자 정의 이름(예: 특정 스마트 홈 장치 이름)을 잘못 인식하는 STT 모델의 문제를 해결하기 위해, Home Assistant 인스턴스에서 가져온 이름을 모델에 편향시키는 기능을 제공합니다.

작동 방식

서버는 Wyoming 프로토콜과 STT 백엔드(faster-whisper, qwen3-asr 등) 사이의 브리지 역할을 합니다. Home Assistant API에 연결하여 대화에서 노출된 엔티티, 영역, 층의 목록을 가져올 수 있습니다. 이러한 이름들은 모델에 프롬프트로 제공되어 해당 특정 용어의 인식 정확도를 향상시킵니다. 성능을 유지하기 위해, 명령어에서 사용될 가능성이 높은 이름(예: 노출된 엔티티가 있는 영역 우선, 그 다음 라이트, 팬 등의 특정 장치 도메인)을 우선순위로 설정합니다.

대상 사용자

Home Assistant와 Wyoming 프로토콜을 사용하며, 자신의 홈 오토메이션 환경에 맞는 정확도가 높은 로컬 고성능 음성 인식 서비스를 원하는 사용자들.

주요 기능

  • Home Assistant 통합: 엔티티 이름과 별칭을 자동으로 동기화하여 STT 모델에 편향을 적용.
  • 유연한 백엔드 지원: faster-whisperqwen3-asr 백엔드를 지원.
  • 하드웨어 가속: NVIDIA GPU를 위한 GPU 지원 Docker 이미지를 제공하여 인식 속도를 향상.
  • 효율적인 프롬프트 처리: 모델의 토큰 예산 내에 가장 관련성 높은 이름이 포함되도록 우선순위 기반 시스템을 구현.
  • 배포 옵션: Home Assistant Add-on, 독립형 Docker 컨테이너, 또는 로컬 Python 설치로 사용 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트