HorizonWind2004/reconstruction-alignment

[ICLR 2026] RecA: visual understanding help generation through self-supervised learning

What it solves

RecA (Reconstruction Alignment) は、統一マルチモーダルモデル (UMMs) における視覚的理解と画像生成の間のギャップを解消します。高価な画像専用のキャプションや強化学習を必要とせずに、テキストから画像生成および画像編集の品質を向上させることを目的としています。

How it works

RecA は自己教師あり事後学習手法です。モデルが自身の内部的な視覚的理解特徴を用いて、元の画像をターゲットとして画像を再構成するように、学習済み UMMs を学習させます。このプロセスにより、モデルの生成能力と意味的理解を一致させ、生成・編集タスクにおける性能向上へと繋げ、元の推論インターフェースを維持しながら実現します。

Who it’s for

自己教師ありアライメントを通じて、画像生成・編集能力を向上させたいと考えている、統一マルチモーダルモデルの研究者や開発者。

Highlights

  • Architecture Agnostic: BAGEL, Harmon, OpenUni, および Show-o を含む複数のアーキテクチャで検証済み。
  • Efficient Training: 例えば、 BAGEL は 6 x 80GB A100s を使用して、約 4.5 時間で生成・編集ベンチマークの性能を向上させることができます。
  • Self-Supervised: 手動のキャプションではなく、元の画像をターゲットとして使用します。
  • Performance Gains: GenEval や DPGBench などのベンチマークにおいて、様々なモデルサイズ (0.5B から 14B パラメータ) で大幅な性能向上を示しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch