wafer-bob/ASASR

[ICML 2026] Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution (Official Implementation)

何を解決するか

ASASRは、多くの生成型SR手法で見られる人工的なアーティファクトを導入せずに、構造的忠実性とスペクトル的一貫性を維持しながら低解像度画像を拡大するという「忠実な」画像スーパーレゾリューション(SR)の問題に対処します。

動作原理

FLUX.1-devのバックボーンに基づき、ASASRは二重LoRA推論パイプライン(ベースSR事前知識とDPO精製)を使用して画像を再構成します。以下の3つの技術的革新を導入しています:

  1. カラーノイズフロー:標準的なガウスノイズに代わり、自然画像多様体と整合するスペクトル形状のカーネルを使用します。
  2. ソボレフ誘導幾何学(S-DPO):リーマン計量と周波数重み付きDirect Preference Optimization(DPO)を用いて、高周波構造をより良く保持します。
  3. 敵対的多様体ガイド(AMG):ベースラインSRアーティファクトを模倣するように訓練された敵対ネットワークを用い、DPOプロセスをより忠実な再構成へと導く「ハードネガティブ」を生成します。

対象ユーザー

画像修復、スーパーレゾリューション、生成AIに取り組む研究者や開発者で、一般的な生成型幻覚やアーティファクトを回避する高忠実度拡大が必要な方々。

主な特徴

  • 最先端の性能:DIV2K-Val(Real-ESRGAN ×4)で最先端、RealSRでは第3位。
  • 二重LoRAアーキテクチャ:ベースSR LoRAとDPO精製LoRAを組み合わせ、バランスの取れた再構成を実現。
  • 敵対的訓練:専用の敵対ネットワークを用いて、好み最適化のための現実的な失敗ケースを合成。
  • 包括的な評価:PSNR、SSIM、LPIPSに加え、非参照品質評価(MANIQA、MUSIQ、CLIPIQA+)を含む包括的なメトリクスセット。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト