dseditor/QwenASRMiniTool

基於OpenVino-int8權重,精簡的QwenASR小工具,用於即時辨識以及字幕轉換使用

解决的问题

QwenASRMiniTool 是一个本地语音转文字工具,允许用户从音频文件、视频和实时麦克风录音生成 SRT 字幕,且数据不会离开用户的计算机。它简化了非专业人士的离线转录流程,为云服务提供了一个免费且私密的替代方案。

工作原理

该工具采用基于 WebView 的界面,并支持多种推理后端,以确保在不同硬件上的兼容性:

  • 推理核心:使用 CrispASR(通过 Vulkan GPU)支持 NVIDIA、AMD 和 Intel GPU,使用 OpenVINO 实现纯 CPU 执行。
  • 模型:利用 Qwen3-ASR(包括专门的日本动漫版本)和 Whisper (Breeze-ASR-26) 模型,实现 30 种语言的高精度转录。
  • 处理流程:使用 FFmpeg 从视频文件中提取音频,使用 Silero-VAD 进行语音活动检测,以处理实时录音中的停顿。
  • 附加功能:包含 ForcedAligner 用于生成单词级时间戳(卡拉OK模式),以及基于 ONNX 的引擎实现说话人分离。

适用人群

  • 需要对会议、播客或讲座进行私密离线转录的个人。
  • 希望为视频或歌词生成单词级精确字幕的内容创作者。
  • 拥有不同硬件(从高端 GPU 到基础 CPU)但需要简单“开箱即用”ASR 工具的用户。

核心亮点

  • 本地化 & 隐私安全:所有处理均在设备上完成,数据不会上传至云端。
  • 硬件无关:支持通过 Vulkan(NVIDIA/AMD/Intel)实现 GPU 加速,以及通过 OpenVINO 实现纯 CPU 模式。
  • 卡拉OK模式:提供单词级高亮,实现精确的字幕对齐与审校。
  • 说话人分离:自动识别并标注转录中的不同说话人。
  • 批量处理:支持导入并顺序处理多个音频/视频文件。
  • API 与远程访问:内置 OpenAI 兼容的转录 API 和 Cloudflare 隧道,支持移动设备安全远程上传。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目