Sharrnah/whispering

Whispering Tiger - OpenAI's whisper (and other models) with OSC and Websocket support. Allowing live transcription / translation in VRChat and Overlays in most Streaming Applications

해결하는 문제

Whispering Tiger는 실시간 오디오 스트림 또는 게임 내 텍스트의 음성 인식 및 번역을 위한 도구입니다. 마이크나 시스템 오디오에서 오디오를 캡처할 수 있으며, 화면 이미지에서 텍스트(OCR)를 추출하여 웹 브라우저로 WebSockets를 통해 결과를 전송하거나, OSC를 통해 VRChat과 같은 스트리밍 오버레이 또는 애플리케이션에 통합할 수 있습니다.

작동 방식

이 소프트웨어는 사용자의 컴퓨터에서 완전히 로컬로 실행됩니다. 다양한 작업을 위해 여러 AI 모델을 통합합니다:

  • 음성-텍스트 변환 및 번역: OpenAI의 Whisper, Meta의 Seamless M4T, Microsoft의 Phi-4 Multimodal LLM 등을 사용하여 말하는 언어를 인식하고 번역합니다.
  • 텍스트 번역: NLLB-200, M2M-100 등으로 고정확도 텍스트 간 번역을 수행합니다.
  • OCR: EasyOCR, GOT-OCR 2.0, Phi-4를 사용하여 이미지/게임에서 텍스트를 캡처하고 번역합니다.
  • 음성 합성(TTS): Silero, Kokoro, Zonos TTS를 사용하여 인식 또는 번역된 텍스트를 음성으로 변환합니다.
  • 음성 처리: 음성 활동 탐지(VAD) 및 검색 기반 음성 변환(RVC)을 포함합니다.

대상 사용자

주로 스트리머, 게이머(특히 VRChat 사용자), 시스템 오디오 또는 화면 콘텐츠의 실시간 로컬 번역 및 음성 인식이 필요한 사용자에게 적합합니다.

주요 특징

  • 100% 로컬 실행: 모델을 다운로드하면 인터넷 연결이 필요 없습니다.
  • 다중 모달 기능: 음성 인식, OCR, LLM 기반 질문 응답을 하나의 도구에서 통합합니다.
  • 광범위한 언어 지원: NLLB-200 등 다양한 모델을 통해 200개 이상의 언어를 지원합니다.
  • 유연한 출력: WebSockets 또는 OSC를 통해 웹 브라우저로 데이터를 전송하여 오버레이에 통합 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트