facebookresearch/tuna-2

Official implementation of Tuna-2: Pixel Embeddings Beat Vision Encoders for Unified Understanding and Generation

解決的問題

Tuna-2 解決了統一多模態模型 (UMM) 的複雜性問題,這些模型通常依賴於諸如變分自編碼器 (VAEs) 或表示編碼器等沉重的視覺編碼組件來處理圖像。其目標是在提高理解與生成任務性能的同時,簡化架構。

工作原理

該專案透過逐步移除視覺編碼層來演進架構。原始的 Tuna 使用 VAE,Tuna-R 使用表示編碼器,而 Tuna-2 則將兩者都移除了,利用直接的 patch embedding 層將原始圖像輸入作為像素嵌入進行處理。這種精簡的方法使模型能夠更直接地處理視覺數據,在多模態基準測試中表現優於其前代產品。

適用對象

致力於統一多模態模型研究的研究人員與開發人員,特別是那些對高效圖像生成 (text-to-image)、圖像編輯以及開發繞過傳統視覺編碼器的原生多模態架構感興趣的人士。

亮點

  • 統一架構:在單一框架內同時處理理解與生成任務。
  • 像素空間處理:使用直接的 patch embeddings 取代複雜的視覺編碼器來處理原始圖像。
  • 多功能任務:支援 text-to-image 生成與圖像編輯。
  • 可擴展至影片:包含用於影片生成模型訓練與推論的完整程式碼庫。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案