dimastatz/whisper-flow
Whisper-Flow is a framework designed to enable real-time transcription of audio content using OpenAI’s Whisper model. Rather than processing entire files after upload (“batch mode”), Whisper-Flow accepts a continuous stream of audio chunks and produces incremental transcripts immediately.
解決的問題
Whisper Flow 將 OpenAI 的 Whisper 模型從批次處理工具轉變為即時語音轉寫服務。解決了必須等待整個音訊檔案上傳並處理完畢後才能取得轉錄結果的問題,讓應用程式能立即實現串流式語音轉文字功能。
運作方式
本專案使用「滑動視窗」技術,處理以連續資料包或「區塊」形式傳輸的串流音訊資料。根據自然的語音模式(如停頓或說話人切換)將音訊流分割為段落。在音訊處理過程中,服務會回傳一系列持續更新的片段轉錄事件,直到最終段落完成為止。
適用對象
希望使用 Whisper 模型將即時、低延遲語音轉文字功能整合至軟體中的開發者,以及需要 Python 套件來管理串流音訊會話的使用者。
主要特色
- 即時串流處理:立即將音訊區塊轉換為文字,而非批次處理檔案。
- 低延遲:在 M1 Mac 硬體上實測延遲低於 500ms。
- 彈性部署:可透過 WebSockets 作為獨立的 FastAPI 伺服器執行,或作為 Python 套件整合至專案中。
- 支援 PCM 音訊:專為 16 kHz 單聲道 16 位元有符號整數音訊資料設計。
相關
- 專案
- 專案
- 專案
- 專案
- 專案