UVA-Computer-Vision-Lab/OmniShotCut

OmniShotCut is a sensitive and more informative SoTA on Shot Boundary Detection task.

何を解決するか

OmniShotCut は、アニメ、ブログ、ゲーム、スポーツなど多様な動画ソースにおけるショット境界検出(SBD)の課題を解決することを目的としています。特に、突然のジャンプカットと徐々に変化するトランジション(ディゾルブ、フェード、ワイプなど)を正確に識別する課題に取り組み、連続するカメラの動きや照明の変化によって引き起こされる誤検出を低減します。

動作方法

このプロジェクトは、ショットクエリベースのビデオトランスフォーマーを実装しています。このアーキテクチャにより、モデルは動画フレーム内の関係性パターンを認識し、実際のショット変更と視覚的ノイズを区別できます。Pythonライブラリとして pip を通じてデプロイでき、動画ファイル、numpy配列、またはtorchテンソルでの推論をサポートしています。

対象ユーザー

このツールは、動画処理、動画編集の自動化、および動画ベースのAIモデル(例:ワールドモデルの事前学習やファインチューニングデータの準備)のデータキュレーションに取り組む開発者や研究者向けです。

特徴

  • 広範な互換性: スクリーンレコーディング、ショート動画、アニメなど、さまざまなコンテンツタイプに対応。
  • ホログラフィック検出: 明確なカットと複雑なトランジション(ディゾルブ、フェード、ワイプ)の両方を検出可能。
  • 頑健性: v1.5モデルは、ストロボライトやカメラの動きによって引き起こされる誤ったカットを特に低減しています。
  • 柔軟な入力: 動画ファイルや、生のテンソル/ numpy フレームデータを直接処理可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト