Sharrnah/whispering

Whispering Tiger - OpenAI's whisper (and other models) with OSC and Websocket support. Allowing live transcription / translation in VRChat and Overlays in most Streaming Applications

何を解決するか

Whispering Tiger は、リアルタイムでの音声ストリームやゲーム内テキストの音声認識と翻訳を行うツールです。マイクやシステム音声からの音声をキャプチャできるほか、画面の画像からテキスト(OCR)を取得し、WebSockets経由でWebブラウザに結果を出力するか、OSC経由でVRChatなどのストリーミングオーバーレイやアプリケーションに統合できます。

動作方法

このソフトウェアはユーザーのマシン上で完全にローカルで実行されます。複数のAIモデルを統合して、さまざまなタスクを処理します:

  • 音声認識・翻訳:OpenAIのWhisper、MetaのSeamless M4T、MicrosoftのPhi-4 Multimodal LLM などのモデルを使用して、音声をテキストに変換し、翻訳します。
  • テキスト翻訳:NLLB-200、M2M-100 などを使って、高精度なテキスト間翻訳を実現します。
  • OCR:EasyOCR、GOT-OCR 2.0、Phi-4 を使用して、画像やゲーム内のテキストを取得・翻訳します。
  • 音声合成(TTS):Silero、Kokoro、Zonos TTS を使って、音声認識や翻訳結果を音声に変換します。
  • 音声処理:音声活動検出(VAD)やリトリーバルベース音声変換(RVC)を含みます。

対象ユーザー

主にストリーマー、ゲーマー(特にVRChatユーザー)、システム音声や画面コンテンツのリアルタイムローカル翻訳・音声認識が必要なユーザー向けに設計されています。

特徴

  • 100% ローカル実行:モデルをダウンロードすれば、インターネット接続は不要です。
  • マルチモーダル機能:音声認識、OCR、LLMベースの質問応答を1つのツールで統合しています。
  • 広範な言語対応:NLLB-200 など、さまざまなモデルで200以上の言語をサポートしています。
  • 柔軟な出力:WebSocketsまたはOSC経由でWebブラウザにデータを送信し、オーバーレイに統合可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト