HorizonWind2004/reconstruction-alignment

[ICLR 2026] RecA: visual understanding help generation through self-supervised learning

What it solves

RecA (Reconstruction Alignment) 解决了统一多模态模型 (UMMs) 中的视觉理解与图像生成之间的差距。它旨在无需昂贵的图像特定说明文字 (captions) 或强化学习的情况下,提升文本到图像生成与图像编辑的质量。

How it works

RecA 是一种自我监督式后训练方法。它训练预训练的 UMMs 通过使用原始图像作为目标,从其自身的内部视觉理解特征中重建图像。这个过程将模型的生成能力与语义理解对齐,从而转移到生成与编辑任务中,从而获得更好的性能,同时保持原有的推理接口。

Who it’s for

对于想要通过自我监督式对齐来增强图像生成与图像编辑能力的统一多模态模型研究人员与开发者。

Highlights

  • Architecture Agnostic: 已在包括 BAGEL, Harmon, OpenUni, 和 Show-o 在内的多种架构上进行了验证。

  • Efficient Training: 例如, BAGEL 可以使用 6 x 80GB A100s 在大约 4.5 小时内提升图像生成与图像编辑基准测试的表现。

  • Self-Supervised: 使用原始图像作为目标,而不是手动说明文字 (captions)。

  • Performance Gains: 在 GenEval 和 DPGBench 等基准测试中,不同模型规模 (0.5B 到 14B 参数) 展现了显著的性能提升。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch