modelscope/FunClip
FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.
解決する課題
FunClipは、音声内容、話者の識別、またはAIによる分析に基づいて、ビデオの特定のセグメントを抽出できる自動ビデオクリッピングツールです。長いビデオをスクロールして、特定の引用やシーンを探してカットするという手作業を排除します。
仕組み
このツールは、音声およびビデオ理解モデルのパイプラインを使用しています:
- 音声認識 (ASR): AlibabaのFunASR(具体的にはParaformer、Fun-ASR-Nano、SenseVoice)を活用し、ビデオのオーディオをタイムスタンプ付きのテキストに書き起こします。
- 話者識別: CAM++モデルを使用して異なる話者を認識し、ユーザーが話している人物に基づいてセグメントをクリップできるようにします。
- 選択とクリッピング: ユーザーは書き起こしからテキストセグメントを手動で選択するか、LLM(QwenやGPTなど)を使用して、プロンプトに基づいて関連するタイムスタンプを自動的に特定できます。
- 視覚的理解: オプションとして、TwelveLabs Pegasusと統合し、視覚と音声の両方を推論して、より正確なハイライト検出を行います。
対象者
長尺のビデオコンテンツから、特定の発言セグメントや話者固有のクリップを迅速に分離する必要があるコンテンツクリエイター、ビデオエディター、研究者。
ハイライト
- AI駆動のクリッピング: LLMを統合し、自然言語プロンプトに基づいてビデオセグメントを自動的に特定・抽出します。
- 話者ベースのトリミング: 自動認識された話者IDを使用して、特定の話者のセグメントをクリップできます。
- 多言語サポート: 標準中国語、英語、日本語、および様々な中国語の方言をサポートしています。
- ホットワードのカスタマイズ: SeACo-Paraformerを介して、エンティティ単語や名前を指定してASRの精度を向上させることができます。
- 包括的な出力: フルビデオのSRT字幕とターゲットセグメントのSRT字幕を自動生成します。