Sharrnah/whispering
Whispering Tiger - OpenAI's whisper (and other models) with OSC and Websocket support. Allowing live transcription / translation in VRChat and Overlays in most Streaming Applications
何を解決するか
Whispering Tiger は、リアルタイムでの音声ストリームやゲーム内テキストの音声認識と翻訳を行うツールです。マイクやシステム音声からの音声をキャプチャできるほか、画面の画像からテキスト(OCR)を取得し、WebSockets経由でWebブラウザに結果を出力するか、OSC経由でVRChatなどのストリーミングオーバーレイやアプリケーションに統合できます。
動作方法
このソフトウェアはユーザーのマシン上で完全にローカルで実行されます。複数のAIモデルを統合して、さまざまなタスクを処理します:
- 音声認識・翻訳:OpenAIのWhisper、MetaのSeamless M4T、MicrosoftのPhi-4 Multimodal LLM などのモデルを使用して、音声をテキストに変換し、翻訳します。
- テキスト翻訳:NLLB-200、M2M-100 などを使って、高精度なテキスト間翻訳を実現します。
- OCR:EasyOCR、GOT-OCR 2.0、Phi-4 を使用して、画像やゲーム内のテキストを取得・翻訳します。
- 音声合成(TTS):Silero、Kokoro、Zonos TTS を使って、音声認識や翻訳結果を音声に変換します。
- 音声処理:音声活動検出(VAD)やリトリーバルベース音声変換(RVC)を含みます。
対象ユーザー
主にストリーマー、ゲーマー(特にVRChatユーザー)、システム音声や画面コンテンツのリアルタイムローカル翻訳・音声認識が必要なユーザー向けに設計されています。
特徴
- 100% ローカル実行:モデルをダウンロードすれば、インターネット接続は不要です。
- マルチモーダル機能:音声認識、OCR、LLMベースの質問応答を1つのツールで統合しています。
- 広範な言語対応:NLLB-200 など、さまざまなモデルで200以上の言語をサポートしています。
- 柔軟な出力:WebSocketsまたはOSC経由でWebブラウザにデータを送信し、オーバーレイに統合可能です。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト