Moyf/moys-asr-workflow
Moy 的 ASR 字幕生成工作流及编辑器,简称 MAW
何を解決するか
音声をテキストに自動変換し、専用のエディタで字幕を精査・エクスポートできるワークフローにより、ローカルメディアファイルの字幕作成プロセスを簡素化します。AIによる原始的な音声認識(通常は手動での修正が必要)と最終的なエクスポートされた字幕ファイル(SRT、ASS)の間のギャップを埋めます。
動作方法
このワークフローは3つの主要ステージで構成されています:変換、編集、エクスポート。ユーザーは選択したASR(音声認識)サービス(Qwen、Fun-ASR、Soniox、OpenAIなど)のAPIキーを提供し、ソフトウェアがメディアのアップロードと変換を処理します。結果として得られるデータは.mospプロジェクトファイルとして保存され、MAWE Serverエディタで波形位置の調整やビジュアルプレビューを使用して正確な修正が可能です。最後に、字幕は標準フォーマットにエクスポートされます。
対象ユーザー
動画制作、編集、翻訳を行うクリエイターで、AIによる音声認識字幕を効率的に生成・精査したい方。
特徴
- 複数プロバイダ対応:Qwen、Fun-ASR、Soniox、Tencent Cloud、OpenAIなど、さまざまなASRサービスと統合可能。
- 高度な編集機能:MAWEエディタには波形ベースの位置調整、セグメントの分割・結合、無音ギャップ処理機能を搭載。
- 二重トラック字幕:2番目の字幕トラックをインポートして並列編集が可能。トラックの結合・分離、トラック間のスナップ機能もサポート。
- 自動化対応:バッチ処理やAI駆動の自動化に対応する公開CLIを備えています。
- ローカルオプション:Qwen3-ASR、FunASR、Faster-WhisperなどのローカルASRモデルに対する実験的サポートを提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト