deepgenteam/deepgen

A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

解決的問題

DeepGen 1.0 是一個輕量級統一多模態模型,旨在單一框架內處理多種圖像相關任務。它解決了在圖像生成、編輯與推理中需透過龐大模型擴展才能達成高表現的挑戰,提供比大型先進模型更高效的替代方案。

工作原理

DeepGen 1.0 結合了 3B 參數的視覺語言模型(VLM)與 2B 參數的擴散轉換器(DiT)。它使用稱為堆疊通道橋接(SCB)的深度對齊框架,從 VLM 提取階層特徵,並與「思考令牌」融合,以引導生成主幹。

模型分為三個階段訓練:

  1. 對齊預訓練:使用大規模圖像-文字對與編輯三元組,同步 VLM 與 DiT 的表示。
  2. 聯合監督微調(SFT):在生成、編輯與推理任務的混合資料上進行訓練。
  3. 強化學習(RL):使用 MR-GRPO 與混合獎勵函數,提升生成品質並增強與人類偏好的一致性。

適用對象

本專案適用於從事多模態 AI 的研究人員與開發者,特別是尋找輕量但強大的模型,用於文字轉圖像生成、圖像編輯與基於推理的圖像操作者。

主要亮點

  • 統一功能:單一模型即可支援一般圖像生成、一般圖像編輯、推理式圖像生成、推理式圖像編輯,以及文字渲染。
  • 輕量架構:總參數僅 5B(3B VLM + 2B DiT),性能卻可與 3~16 倍更大的模型競爭。
  • 強化推理引導:採用堆疊通道橋接(SCB)實現更佳語意理解與細緻控制。
  • 與 Diffusers 兼容:提供與 Hugging Face Diffusers 庫相容的格式,方便整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案