Moyf/moys-asr-workflow

Moy 的 ASR 字幕生成工作流及编辑器,简称 MAW

何を解決するか

音声をテキストに自動変換し、専用のエディタで字幕を精査・エクスポートできるワークフローにより、ローカルメディアファイルの字幕作成プロセスを簡素化します。AIによる原始的な音声認識(通常は手動での修正が必要)と最終的なエクスポートされた字幕ファイル(SRT、ASS)の間のギャップを埋めます。

動作方法

このワークフローは3つの主要ステージで構成されています:変換、編集、エクスポート。ユーザーは選択したASR(音声認識)サービス(Qwen、Fun-ASR、Soniox、OpenAIなど)のAPIキーを提供し、ソフトウェアがメディアのアップロードと変換を処理します。結果として得られるデータは.mospプロジェクトファイルとして保存され、MAWE Serverエディタで波形位置の調整やビジュアルプレビューを使用して正確な修正が可能です。最後に、字幕は標準フォーマットにエクスポートされます。

対象ユーザー

動画制作、編集、翻訳を行うクリエイターで、AIによる音声認識字幕を効率的に生成・精査したい方。

特徴

  • 複数プロバイダ対応:Qwen、Fun-ASR、Soniox、Tencent Cloud、OpenAIなど、さまざまなASRサービスと統合可能。
  • 高度な編集機能:MAWEエディタには波形ベースの位置調整、セグメントの分割・結合、無音ギャップ処理機能を搭載。
  • 二重トラック字幕:2番目の字幕トラックをインポートして並列編集が可能。トラックの結合・分離、トラック間のスナップ機能もサポート。
  • 自動化対応:バッチ処理やAI駆動の自動化に対応する公開CLIを備えています。
  • ローカルオプション:Qwen3-ASR、FunASR、Faster-WhisperなどのローカルASRモデルに対する実験的サポートを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト