deepgenteam/deepgen
A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing
何を解決するか
DeepGen 1.0 は、複数の画像関連タスクを1つのフレームワーク内で処理できる軽量な統合マルチモーダルモデルです。画像生成、編集、推論において高いパフォーマンスを達成するために巨大なモデルスケーリングが必要な課題に対処し、はるかに大きな最先端モデルに比べてより効率的な代替手段を提供します。
動作方法
DeepGen 1.0 は、3Bパラメータのビジョン言語モデル(VLM)と2Bパラメータのディフュージョントランスフォーマー(DiT)を組み合わせています。階層的な特徴をVLMから抽出し、「think tokens」に統合して生成バックボーンをガイドするため、深層アライメントフレームワークであるスタックドチャネルブリッジング(SCB)を使用しています。
モデルは3段階で訓練されます:
- アライメント事前学習:大規模な画像-テキストペアおよび編集トリプレットを使用して、VLMとDiTの表現を同期します。
- 共同教師あり微調整(SFT):生成、編集、推論のタスクの混合データで訓練します。
- 強化学習(RL):MR-GRPOを用い、複数の報酬関数の混合により生成品質と人間の好みの整合性を向上させます。
対象ユーザー
このプロジェクトは、マルチモーダルAIに取り組む研究者や開発者向けです。特に、テキストから画像生成、画像編集、推論に基づく画像操作に使える軽量かつ強力なモデルを探している方々に適しています。
主な特徴
- 統合された機能:1つのモデルで一般画像生成、一般画像編集、推論による画像生成、推論による画像編集、テキストレンダリングをサポートします。
- 軽量アーキテクチャ:合計5Bパラメータ(3B VLM + 2B DiT)ですが、3~16倍大きなモデルと競合可能な性能を発揮します。
- 推論を重視したガイド:スタックドチャネルブリッジング(SCB)により、より良い意味理解と細かい制御が可能になります。
- Diffusers互換:Hugging Face Diffusersライブラリと互換性のあるフォーマットを提供し、簡単に統合できます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト