bytedance/vidi
The official repo for "Vidi: Large Multimodal Models for Video Understanding and Editing"
解決的問題
Vidi 解決了全面的影片理解與創作挑戰。它為從精確的時間檢索(根據文本查詢在影片中尋找特定時間範圍)、時空定位(在特定時間範圍內定位物件)到高階影片分析與自動編輯的各種任務,提供了一個統一的框架。
工作原理
Vidi 是專為影片理解與編輯 (VUE) 設計的大規模多模態模型 (LMM) 系列。它處理影片輸入以執行多個不同的操作:
- 理解:可以透過檢索識別特定片段、在物件周圍繪製邊界框(定位)、生成章節標題、識別精彩片段,並回答有關影片內容的問題 (VQA/Thinking)。
- 創作:透過其「Vidi-Edit」功能,模型可以接收多個上傳的影片,並自動生成包含故事情節、音樂與特效的編輯後影片。
- 評估:該專案包含多個基準測試 (VUE-PLOT, VUE-STG, VUE-TR-V2),用於衡量情節理解、時空定位與時間檢索方面的性能。
適用對象
- AI 研究人員:從事多模態模型、影片分析與自動影片編輯工作的人員。
- 開發者:希望將進階影片檢索與定位功能整合到應用程式中的使用者。
- 內容創作者:需要影片摘要、精彩片段提取與編輯自動化工具的人員。
亮點
- 多任務能力:支援定位、檢索、分章節、精彩片段提取與 VQA。
- 自動編輯:能夠從原始片段生成包含音樂與特效的完整編輯影片。
- 全面的基準測試:為時空定位與情節理解提供專業的評估集。
- 模型權重:提供附帶微調程式碼的 Vidi-7B 與 Vidi1.5-9B 模型。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch