HorizonWind2004/reconstruction-alignment

[ICLR 2026] RecA: visual understanding help generation through self-supervised learning

What it solves

RecA (Reconstruction Alignment) 解決了統一多模態模型 (UMMs) 中視覺理解與影像生成之間的差距。其目標是在不需要昂貴的影像特定說明文字 (captions) 或強化學習的情況下,提升文字轉影像生成與影像編輯的品質。

How it works

RecA 是一種自我監督式後訓練方法。它訓練預訓練的 UMMs 透過使用原始影像作為目標,從其自身的內部視覺理解特徵中重建影像。這個過程將模型的生成能力與其語義理解對齊齊,進而轉移到生成與編輯任務中,從而獲得更好的性能,同時保持原有的推理介面。

Who it’s for

對於想要透過自我監督式對齊來增強影像生成與影像編輯能力的統一多模態模型研究人員與開發人員。

Highlights

  • Architecture Agnostic: 已在包括 BAGEL, Harmon, OpenUni, 和 Show-o 在內的多種架構上進行了驗證。
  • Efficient Training: 例如, BAGEL 可以使用 6 x 80GB A100s 在大約 4.5 小時內在生成與編輯基準測試中得到提升。
  • Self-Supervised: 使用原始影像作為目標,而非手動說明文字 (captions)。
  • Performance Gains: 在 GenEval 和 DPGBench 等基準測試中,不同模型規模 (0.5B 到 14B 參數) 展現了顯著的性能提升。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch