bytedance/Lance
A 3B-active-parameter native unified multimodal model for image and video understanding, generation, and editing.
解決的問題
Lance 解決了建立單一且高效模型以處理多種多模態任務的挑戰。無需為不同需求使用獨立的模型,它提供了一個統一的框架,用於圖像與影片的理解、生成與編輯。
工作原理
Lance 是一個原生的統一多模態模型,擁有 30 億個活躍參數。它基於分階段多任務訓練方案,從零開始訓練,使用最多 128 張 A100 GPU。它支援廣泛的任務,包括文字轉圖像(T2I)、文字轉影片(T2V)、圖像轉影片(I2V)、圖像/影片編輯以及視覺理解(圖像描述與問答)。
適用對象
此專案主要是一個研究用的成果,面向研究統一多模態建模的研究人員與開發者,特別是那些希望在相對較小的模型規模與有限的運算預算下,實現圖像與影片任務的高表現的人。
主要亮點
- 統一能力:一個模型即可支援圖像/影片的生成、編輯與理解。
- 高效擴展:僅使用 30 億個活躍參數,同時在基準測試中保持競爭力。
- 多功能任務支援:支援文字轉影片(T2V)、圖像轉影片(I2V)、文字轉圖像(T2I)以及多輪一致性編輯。
- 研究就緒:包含微調程式碼,並由 vLLM-Omni 支援。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案