Sharrnah/whispering-ui
Native UI for the Whispering Tiger project - https://github.com/Sharrnah/whispering (live transcription / translation)
解決する課題
Whispering Tiger UIは、Whispering TigerアプリケーションのネイティブWindowsインターフェースを提供し、ユーザーがオーディオストリームやゲーム内画像をリアルタイムで簡単に文字起こし・翻訳できるようにします。バックエンドプラットフォームの管理の複雑さを排除し、高度な技術的知識がなくても、オーディオデバイス、AIモデル、出力方法を設定できるようにします。
仕組み
このUIは、Whispering Tigerバックエンドのコントロールパネルとして機能します。オーディオ入出力デバイスの選択、AIモデルのサイズと精度(GPU用のCUDAまたはCPU)の選択、WebsocketsやOSCを介したWebブラウザやVRChatなどの出力チャネルの設定が可能です。また、PCのオーディオを直接キャプチャするためのループバックオーディオデバイスもサポートしています。
対象ユーザー
自身のマシンからのオーディオや画面上のテキスト(OCR)のリアルタイム翻訳・文字起こしを必要とするゲーマー、ストリーマー、およびVRChatなどのバーチャルリアリティプラットフォームのユーザー。
ハイライト
- マルチモーダルAI機能: 音声からテキストへの変換、テキスト翻訳、テキストから音声への変換、およびゲーム内画像の画像からテキストへの変換(OCR)をサポート。
- プラグインによる拡張性: Emotion Prediction、RVC (Retrieval-based Voice Conversion)、LLM統合などのプラグインをサポート。
- ハードウェアアクセラレーション: NVIDIA GPU用のCUDAをサポートし、文字起こし速度の向上とレイテンシの低減を実現。
- 柔軟な出力: WebsocketsまたはOSCを使用して、結果をWebブラウザやVRChatに送信。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト