dseditor/QwenASRMiniTool

基於OpenVino-int8權重,精簡的QwenASR小工具,用於即時辨識以及字幕轉換使用

何を解決するか

QwenASRMiniTool は、ユーザーがオーディオファイル、動画、ライブマイク録音から SRT サブタイトルを生成できるローカルな音声認識ツールです。データはすべてコンピュータ内に留まり、クラウドにアップロードされません。非専門家向けにオフライン音声認識を簡素化し、クラウドサービスの代替として無料かつプライベートな選択肢を提供します。

動作方法

このツールは WebView ベースのインターフェースを採用し、さまざまなハードウェア環境での互換性を確保するため、複数の推論バックエンドをサポートしています。

  • 推論コア: CrispASR(Vulkan GPU を介して)は NVIDIA、AMD、Intel GPU に対応し、OpenVINO は純粋な CPU 実行に使用されます。
  • モデル: Qwen3-ASR(日本語アニメ向けの特別版を含む)や Whisper (Breeze-ASR-26) といったモデルを活用し、30 言語で高精度な音声認識を実現します。
  • 処理: 動画ファイルからオーディオを抽出するには FFmpeg を使用し、ライブ録音時の休止を検出するには Silero-VAD を活用します。
  • 追加機能: 単語レベルのタイムスタンプ(カラオケモード)を提供する ForcedAligner と、ONNX ベースのエンジンによる話者分離機能を備えています。

対象ユーザー

  • ミーティング、ポッドキャスト、講義のプライベートなオフライン音声認識が必要な個人。
  • 動画や歌詞に単語レベルの正確な字幕を生成したいコンテンツクリエイター。
  • 高性能 GPU から基本的な CPU まで、さまざまなハードウェア環境を持つユーザーで、即時利用可能な ASR ツールを必要とする人。

特徴

  • ローカル & プライベート: すべての処理はデバイス上で行われ、データはクラウドにアップロードされません。
  • ハードウェア非依存: Vulkan(NVIDIA/AMD/Intel)による GPU 加速と、OpenVINO による CPU 唯一モードをサポート。
  • カラオケモード: 単語レベルのハイライトにより、正確な字幕同期とレビューが可能。
  • 話者分離: 音声認識中に異なる話者を自動的に識別・ラベル付け。
  • バッチ処理: 複数のオーディオ/動画ファイルを順次インポート・処理可能。
  • API とリモートアクセス: OpenAI 互換の音声認識 API と Cloudflare 隧道を備え、モバイルデバイスからの安全なリモートアップロードを可能に。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト