deepgenteam/deepgen

A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

解决的问题

DeepGen 1.0 是一个轻量级统一多模态模型,旨在在一个框架内处理多种图像相关任务。它解决了在图像生成、编辑和推理中需要大规模模型扩展才能实现高性能的难题,为比其大数倍的最先进模型提供了一种更高效的替代方案。

工作原理

DeepGen 1.0 结合了 3B 参数的视觉语言模型(VLM)和 2B 参数的扩散 Transformer(DiT)。它使用一种称为堆叠通道桥接(SCB)的深度对齐框架,从 VLM 中提取分层特征,并将其与「思考令牌」融合,以引导生成主干。

该模型分三个阶段进行训练:

  1. 对齐预训练:使用大规模图像-文本对和编辑三元组同步 VLM 和 DiT 的表示。
  2. 联合监督微调(SFT):在生成、编辑和推理任务的混合数据上进行训练。
  3. 强化学习(RL):使用 MR-GRPO 和混合奖励函数来提升生成质量并增强与人类偏好的一致性。

适用人群

本项目适用于从事多模态 AI 的研究人员和开发者,特别是那些需要轻量但强大的模型来实现文本到图像生成、图像编辑以及基于推理的图像操作的人群。

主要亮点

  • 统一能力:一个模型即可支持通用图像生成、通用图像编辑、基于推理的图像生成、基于推理的图像编辑以及文本渲染。
  • 轻量架构:总参数量仅 5B(3B VLM + 2B DiT),但性能可与 3~16 倍更大的模型相媲美。
  • 丰富的推理引导:采用堆叠通道桥接(SCB)实现更优的语义理解与细粒度控制。
  • 与 Diffusers 兼容:提供与 Hugging Face Diffusers 库兼容的格式,便于集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目