Sharrnah/whispering-ui

Native UI for the Whispering Tiger project - https://github.com/Sharrnah/whispering (live transcription / translation)

解決する課題

Whispering Tiger UIは、Whispering TigerアプリケーションのネイティブWindowsインターフェースを提供し、ユーザーがオーディオストリームやゲーム内画像をリアルタイムで簡単に文字起こし・翻訳できるようにします。バックエンドプラットフォームの管理の複雑さを排除し、高度な技術的知識がなくても、オーディオデバイス、AIモデル、出力方法を設定できるようにします。

仕組み

このUIは、Whispering Tigerバックエンドのコントロールパネルとして機能します。オーディオ入出力デバイスの選択、AIモデルのサイズと精度(GPU用のCUDAまたはCPU)の選択、WebsocketsやOSCを介したWebブラウザやVRChatなどの出力チャネルの設定が可能です。また、PCのオーディオを直接キャプチャするためのループバックオーディオデバイスもサポートしています。

対象ユーザー

自身のマシンからのオーディオや画面上のテキスト(OCR)のリアルタイム翻訳・文字起こしを必要とするゲーマー、ストリーマー、およびVRChatなどのバーチャルリアリティプラットフォームのユーザー。

ハイライト

  • マルチモーダルAI機能: 音声からテキストへの変換、テキスト翻訳、テキストから音声への変換、およびゲーム内画像の画像からテキストへの変換(OCR)をサポート。
  • プラグインによる拡張性: Emotion Prediction、RVC (Retrieval-based Voice Conversion)、LLM統合などのプラグインをサポート。
  • ハードウェアアクセラレーション: NVIDIA GPU用のCUDAをサポートし、文字起こし速度の向上とレイテンシの低減を実現。
  • 柔軟な出力: WebsocketsまたはOSCを使用して、結果をWebブラウザやVRChatに送信。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト