UVA-Computer-Vision-Lab/OmniShotCut
OmniShotCut is a sensitive and more informative SoTA on Shot Boundary Detection task.
解決的問題
OmniShotCut 是為了解決來自多樣化影片來源(包括動畫、vlog、遊戲和運動)的鏡頭邊界檢測(SBD)問題而設計的。它特別針對準確識別突然的跳切與漸進式轉場(如溶解、淡入淡出、劃像等)的挑戰,同時減少因持續的鏡頭移動或照明變化所導致的誤報。
工作原理
本專案實作了基於鏡頭查詢的影片 Transformer 架構。此架構讓模型能識別影片幀中的關係性模式,以區分實際的鏡頭變更與視覺雜訊。可透過 pip 作為 Python 套件部署,並支援對影片檔案、numpy 陣列或 torch 張量進行推論。
適用對象
此工具適用於從事影片處理、影片編輯自動化,以及影片導向 AI 模型資料整理的研究人員與開發者(例如用於世界模型預訓練或微調資料準備)。
主要特色
- 廣泛相容性:適用於螢幕錄影、短影片與動畫等多種內容類型。
- 全像檢測:可檢測乾淨的切口與複雜的轉場(如溶解、淡入淡出、劃像)。
- 強健性:v1.5 模型特別減少因閃光燈或鏡頭移動所觸發的誤切口。
- 彈性輸入:支援直接處理影片檔案或原始張量/numpy 幀資料。
相關
- 專案
- 專案
- 專案
- 專案