Sharrnah/whispering

Whispering Tiger - OpenAI's whisper (and other models) with OSC and Websocket support. Allowing live transcription / translation in VRChat and Overlays in most Streaming Applications

解决的问题

Whispering Tiger 是一个用于实时转录和翻译音频流或游戏内文本的工具。它允许用户从麦克风或系统音频中捕获音频,以及从屏幕图像中提取文本(OCR),并通过 WebSockets 将结果输出到网页浏览器,或通过 OSC 用于流媒体叠加层或 VRChat 等应用程序。

工作原理

该软件完全在用户本地机器上运行。它集成了多个 AI 模型以完成不同任务:

  • 语音转文字与翻译:使用 OpenAI 的 Whisper、Meta 的 Seamless M4T 和 Microsoft 的 Phi-4 多模态大模型来转录和翻译语音。
  • 文本翻译:使用 NLLB-200、M2M-100 等模型实现高精度的文本到文本翻译。
  • OCR:使用 EasyOCR、GOT-OCR 2.0 和 Phi-4 从图像/游戏中提取并翻译文本。
  • 文本转语音(TTS):使用 Silero、Kokoro 或 Zonos TTS 将转录或翻译结果转换为语音。
  • 语音处理:包含语音活动检测(VAD)和基于检索的语音转换(RVC)。

适用人群

主要面向主播、游戏玩家(特别是 VRChat 用户),以及需要对系统音频或屏幕内容进行实时本地转录和翻译的任何人。

主要亮点

  • 100% 本地运行:模型下载后无需互联网连接。
  • 多模态能力:在一个工具中整合语音识别、OCR 和基于大模型的问答功能。
  • 广泛的语言支持:多种模型支持大量语言(例如 NLLB-200 支持 200 种语言)。
  • 灵活的输出方式:通过 WebSockets 或 OSC 将数据发送至网页浏览器,便于集成到叠加层中。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目