Sharrnah/whispering
Whispering Tiger - OpenAI's whisper (and other models) with OSC and Websocket support. Allowing live transcription / translation in VRChat and Overlays in most Streaming Applications
解决的问题
Whispering Tiger 是一个用于实时转录和翻译音频流或游戏内文本的工具。它允许用户从麦克风或系统音频中捕获音频,以及从屏幕图像中提取文本(OCR),并通过 WebSockets 将结果输出到网页浏览器,或通过 OSC 用于流媒体叠加层或 VRChat 等应用程序。
工作原理
该软件完全在用户本地机器上运行。它集成了多个 AI 模型以完成不同任务:
- 语音转文字与翻译:使用 OpenAI 的 Whisper、Meta 的 Seamless M4T 和 Microsoft 的 Phi-4 多模态大模型来转录和翻译语音。
- 文本翻译:使用 NLLB-200、M2M-100 等模型实现高精度的文本到文本翻译。
- OCR:使用 EasyOCR、GOT-OCR 2.0 和 Phi-4 从图像/游戏中提取并翻译文本。
- 文本转语音(TTS):使用 Silero、Kokoro 或 Zonos TTS 将转录或翻译结果转换为语音。
- 语音处理:包含语音活动检测(VAD)和基于检索的语音转换(RVC)。
适用人群
主要面向主播、游戏玩家(特别是 VRChat 用户),以及需要对系统音频或屏幕内容进行实时本地转录和翻译的任何人。
主要亮点
- 100% 本地运行:模型下载后无需互联网连接。
- 多模态能力:在一个工具中整合语音识别、OCR 和基于大模型的问答功能。
- 广泛的语言支持:多种模型支持大量语言(例如 NLLB-200 支持 200 种语言)。
- 灵活的输出方式:通过 WebSockets 或 OSC 将数据发送至网页浏览器,便于集成到叠加层中。
相关
- 项目
- 项目
- 项目
- 项目
- 项目