dseditor/QwenASRMiniTool

基於OpenVino-int8權重,精簡的QwenASR小工具,用於即時辨識以及字幕轉換使用

解決的問題

QwenASRMiniTool 是一款本地語音轉文字工具,允許使用者從音訊檔案、影片以及即時麥克風錄音生成 SRT 字幕,且資料不會離開個人電腦。它簡化了非專業人士的離線轉錄流程,提供免費且私密的雲端服務替代方案。

運作方式

此工具採用 WebView 為基礎的介面,並支援多種推理後端,以確保在不同硬體上的相容性:

  • 推理核心:使用 CrispASR(透過 Vulkan GPU)支援 NVIDIA、AMD 與 Intel GPU,使用 OpenVINO 實現純 CPU 執行。
  • 模型:利用 Qwen3-ASR(包含專用的日文動畫版本)與 Whisper (Breeze-ASR-26) 模型,於 30 種語言中實現高準確度轉錄。
  • 處理流程:使用 FFmpeg 從影片檔案中提取音訊,使用 Silero-VAD 進行語音活動偵測,以處理即時錄音中的停頓。
  • 附加功能:包含 ForcedAligner 用於生成單字級時間戳(卡拉OK模式),以及基於 ONNX 的引擎實現說話人分離。

適用對象

  • 需要對會議、播客或講座進行私密離線轉錄的個人。
  • 希望為影片或歌詞生成單字級精確字幕的內容創作者。
  • 擁有不同硬體(從高階 GPU 到基本 CPU)但需要簡單「開箱即用」ASR 工具的使用者。

核心亮點

  • 本地化 & 隱私安全:所有處理均在裝置上完成,資料不會上傳至雲端。
  • 硬體無關:支援透過 Vulkan(NVIDIA/AMD/Intel)實現 GPU 加速,以及透過 OpenVINO 實現純 CPU 模式。
  • 卡拉OK模式:提供單字級高亮,實現精確的字幕對齊與審校。
  • 說話人分離:自動識別並標註轉錄中的不同說話人。
  • 批次處理:支援匯入並順序處理多個音訊/影片檔案。
  • API 與遠端存取:內建 OpenAI 相容的轉錄 API 與 Cloudflare 隧道,支援行動裝置安全遠端上傳。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案