介紹 Lance:一個用於多模態生成與理解的統一 3B 模型

生成式 AI 的領域長期以來一直處於碎片化狀態,不同的模型分別致力於圖像生成、影片合成和視覺理解。雖然專門的模型在特定領域表現出色,但對於單一應用程式(例如需要同時分析影片並進行編輯的工具)而言,維護多個流水線的開銷非常大。

ByteDance 透過 Lance 解決了這個挑戰,這是一個具有 3B 活性參數的原生統一多模態模型。與將不同模型縫合在一起的模組化系統不同,Lance 的設計旨在單一框架內處理圖像和影片的理解、生成與編輯,目標是實現這些多樣化任務之間的協同作用。

一個統一的多模態框架

Lance 是一個「原生」統一模型,這意味著它從底層開始就是為了處理多種模態而構建的。其主要目標是彌合 理解(判別式任務)與 生成(生成式任務)之間的差距。

技術亮點

  • 高效規模: 僅憑 3B 活性參數,Lance 在不犧牲性能的情況下實現了高效能,使其比龐大的 10B+ 參數模型更易於使用。
  • 從零開始訓練: 雖然它利用了現有的 ViT 和 VAE 編碼器,但 Transformer 主幹網路是完全使用分階段多任務配方從零開始訓練的。這確保了模型的內部表示針對其任務的統一性質進行了優化。
  • 計算預算: 該模型是在相對受限的 128 A100 GPU 的預算內開發的,展示了對訓練效率的關注。

多功能能力

Lance 的架構使其能夠執行跨不同媒體類型的廣泛任務。該模型提供了一個統一的命令列介面來處理這些多樣化請求:

1. 生成

  • Text-to-Image (t2i): 從文本提示生成高保真圖像。
  • Text-to-Video (t2v): 從文本描述創建影片序列(最高可達 121 幀)。

2. 編輯

  • 圖像編輯: 根據文本指令修改現有圖像。
  • 影片編輯: 對影片內容進行更改,包括支持多輪一致性編輯,即模型在幾次連續編輯中保持連貫性。

3. 理解

  • 圖像理解 (x2t_image): 執行視覺問答 (VQA) 和複雜的基於圖像的推理(例如,分析餅圖或閱讀車牌)。
  • 影片理解 (x2t_video): 為影片提供簡潔或詳細的字幕,並回答有關片段中動作和物體的特定問題。

性能基準測試

Lance 已針對僅生成模型和其他統一模型進行了評估。結果表明,其小規模並不會阻礙其競爭力。

圖像生成 (GenEval & DPG-Bench)

在 GenEval 中,Lance 獲得了 0.90 的總分,與 TUNA 持平,並超越了 Janus-Pro-7B (0.80) 和 OmniGen2 (0.80) 等較大模型。在 DPG-Bench 中,它在「關係」任務中表現尤為強大,得分為 93.38,高於幾乎所有對比模型。

圖像編輯 (GEdit-Bench)

Lance 在圖像編輯方面展現了強大的性能,獲得了平均分 7.30,超越了其他統一模型如 InternVL-U (6.66) 和 BAGEL (6.52)。

影片生成 (VBench)

在 VBench 評估中,Lance 得分為 85.11,使其位居於 Emu3 (80.96) 和 Show-o2 (81.34) 等其他統一模型之上,甚至超越了數個僅生成模型。

部署與使用

對於開發者和研究人員,Lance 可在 GitHub 和 Hugging Face 上獲取。建議的環境要求為 Python 3.10+、CUDA 12.4+,以及用於推理的至少 40GB VRAM 的 GPU。

社群反應

雖然技術成就受到了讚揚,但在擁擠的 AI 生態系統中,命名挑戰也受到了關注。一位用戶指出,這可能會與現有的且受歡迎的 lance/lancedb 項目進行混淆,建議使用不同的名稱可能會有助於該項目在搜尋結果中更清晰地脫穎而出。

Sources