modelscope/FunClip

FunASR-powered video transcription, subtitle generation, and LLM-assisted clipping tool with a local Gradio UI.

解決する課題

FunClipは、長い動画を手動でスクラブして特定の瞬間を見つける必要をなくす、自動動画クリッピングツールです。音声テキスト、特定の話者、またはAI駆動のコンテンツ分析に基づいて動画セグメントを抽出でき、ハイライトやショートフォームコンテンツの作成プロセスを大幅に高速化します。

仕組み

このツールは、音声モデルとビジョンモデルのパイプラインを使用して動画ファイルを分析します。

  1. 音声からテキストへ: Paraformerシリーズ(ホットワードカスタマイズ用のParaformer-LargeやSeACo-Paraformerを含む)を使用して音声を文字起こしし、正確なタイムスタンプを予測します。
  2. 話者識別: CAM++モデルを統合して異なる話者を認識し、誰が話しているかに基づいてセグメントをクリップできます。
  3. AI支援選択: トランスクリプトをLLM(OrcaRouter経由)にルーティングしたり、TwelveLabs Pegasusなどの動画理解モデルを使用して、自然言語プロンプトに基づいてハイライトセグメントを特定できます。
  4. クリッピング: テキストまたはAIでセグメントが特定されると、ツールは自動的に動画をトリミングし、対応するSRT字幕を生成できます。

対象ユーザー

  • コンテンツクリエイター: 長尺動画を短いクリップにすばやく変換する必要がある人。
  • 動画編集者: 文字起こしベースのトリミングの面倒なプロセスを自動化したい人。
  • 開発者: 自動動画処理用のローカルデプロイ可能なオープンソースツールを求める人。

ハイライト

  • 産業グレードのASR: 正確なタイムスタンプ予測を備えた高性能な中国語ASRモデルを使用。
  • 話者ベースのクリッピング: 自動認識された話者IDに基づいて動画をトリミングする機能。
  • LLM統合: 外部LLMゲートウェイと動画推論モデルを使用したAI駆動のクリッピングをサポート。
  • 柔軟なインターフェース: 自動化用のGradio Web UIとコマンドラインインターフェースの両方を提供。
  • 多言語サポート: 英語、日本語、および複数の中国語方言向けのさまざまなモデルと互換性があります。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト