Sharrnah/whispering
Whispering Tiger - OpenAI's whisper (and other models) with OSC and Websocket support. Allowing live transcription / translation in VRChat and Overlays in most Streaming Applications
解決的問題
Whispering Tiger 是一個用於即時音訊串流或遊戲內文字的語音轉錄與翻譯工具。它可從麥克風或系統音訊中擷取音訊,也能從螢幕影像中提取文字(OCR),並透過 WebSockets 將結果輸出至網頁瀏覽器,或透過 OSC 用於串流覆疊層或 VRChat 等應用程式。
工作原理
此軟體完全在使用者的電腦上本地執行。它整合多個 AI 模型以執行不同任務:
- 語音轉文字與翻譯:使用 OpenAI 的 Whisper、Meta 的 Seamless M4T、Microsoft 的 Phi-4 多模態大模型,進行語音轉錄與翻譯。
- 文字翻譯:採用 NLLB-200、M2M-100 等模型,實現高準確度的文字間翻譯。
- OCR:使用 EasyOCR、GOT-OCR 2.0、Phi-4 從影像/遊戲中擷取並翻譯文字。
- 文字轉語音(TTS):使用 Silero、Kokoro 或 Zonos TTS 將轉錄或翻譯結果轉換為語音。
- 語音處理:包含語音活動偵測(VAD)與基於檢索的語音轉換(RVC)。
適用對象
主要設計給主播、玩家(特別是 VRChat 使用者),以及需要即時、本地化轉錄與翻譯系統音訊或螢幕內容的人。
主要特色
- 100% 本地執行:模型下載後無需網路連接。
- 多模態功能:整合語音辨識、OCR 與基於大模型的問答功能於單一工具中。
- 廣泛的語言支援:多種模型支援大量語言(例如 NLLB-200 支援 200 種語言)。
- 彈性輸出方式:透過 WebSockets 或 OSC 將資料傳送至網頁瀏覽器,便於整合至覆疊層。
相關
- 專案
- 專案
- 專案
- 專案
- 專案