Sharrnah/whispering-ui

Native UI for the Whispering Tiger project - https://github.com/Sharrnah/whispering (live transcription / translation)

해결하는 문제

Whispering Tiger UI는 Whispering Tiger 애플리케이션을 위한 네이티브 Windows 인터페이스를 제공하여 사용자가 오디오 스트림 또는 게임 내 이미지를 실시간으로 쉽게 전사하고 번역할 수 있도록 합니다. 백엔드 플랫폼 관리의 복잡성을 제거하여 사용자가 깊은 기술적 지식 없이도 오디오 장치, AI 모델 및 출력 방법을 구성할 수 있도록 합니다.

작동 방식

UI는 Whispering Tiger 백엔드의 제어판 역할을 합니다. 사용자는 오디오 입출력 장치를 선택하고, AI 모델 크기 및 정밀도(GPU용 CUDA 또는 CPU)를 선택할 수 있으며, Websockets 또는 OSC를 통해 웹 브라우저나 VRChat과 같은 출력 채널을 설정할 수 있습니다. 또한 PC 오디오를 직접 캡처하기 위한 루프백 오디오 장치도 지원합니다.

대상 사용자

자신의 컴퓨터에서 오디오 또는 화면 텍스트(OCR)의 실시간 번역 및 전사가 필요한 게이머, 스트리머 및 VRChat과 같은 가상 현실 플랫폼 사용자.

주요 특징

  • 멀티모달 AI 기능: 음성-텍스트 변환, 텍스트 번역, 텍스트-음성 변환 및 게임 내 이미지에 대한 이미지-텍스트 변환(OCR)을 지원합니다.
  • 플러그인을 통한 확장성: Emotion Prediction, RVC (Retrieval-based Voice Conversion) 및 LLM 통합과 같은 플러그인 지원을 포함합니다.
  • 하드웨어 가속: NVIDIA GPU를 위한 CUDA를 지원하여 전사 속도를 높이고 지연 시간을 줄입니다.
  • 유연한 출력: Websockets 또는 OSC를 사용하여 결과를 웹 브라우저 또는 VRChat으로 전송합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트