連続時間一貫性モデルの簡素化、安定化、スケーリング

OpenAIはsCMという、連続時間一貫性モデルへの新しいアプローチを導入しました。これにより、わずか2つのサンプリングステップで高品質なサンプル生成が可能になります。この手法は、従来の拡散モデルと比較して約50倍の実時間スピードアップを実現し、サンプル品質も同等に保ちます。

sCMによる高速サンプリング

sCMはノイズを直接ノイズフリーなサンプルに変換することで、生成AIの計算オーバーヘッドを大幅に削減します。従来の拡散モデルは単一画像を生成するために数十から数百の逐次的なデノイズステップが必要ですが、sCMはこの段階的プロセスを回避するよう設計されています。

  • Sampling Speed: 単一のA100 GPU上で推論最適化なしで、0.11秒で1サンプルを生成します。
  • Efficiency: 他の最先端生成モデルが同等のFréchet Inception Distance(FID)スコアを達成するために必要な有効サンプリング計算量の10%未満を使用します。
  • Step Reduction: わずか2つのサンプリングステップで、主要な拡散モデルに匹敵する品質を実現します。

技術的実装とスケーリング

sCMは連続時間一貫性モデルの理論的定式化を簡素化し、トレーニングプロセスを安定化させ、モデルをより大規模なデータセットやパラメータ数にスケールさせることを可能にします。OpenAIはImageNet上で512×512の解像度で、15億パラメータのsCMトレーニングをスケールさせました。

知識蒸留

sCMアプローチは、事前学習された教師拡散モデルから知識を蒸留します。OpenAIの研究によれば、教師拡散モデルがスケールアップするにつれてsCMも比例して改善されます。サンプル品質の相対的な差異(FIDスコアの比率で測定)は、モデルサイズが数桁にわたって一貫しており、モデルが拡大するにつれて絶対的な品質ギャップは縮小します。

品質とステップ数の関係

サンプリングステップ数を2以上に増やすことで、sCMと教師拡散モデル間の品質ギャップはさらに縮小します。2ステップでも、教師モデル(通常は数百ステップが必要)に対するFIDスコアの相対差は10%未満です。

制限事項と制約

速度向上にもかかわらず、sCMには特定の技術的依存関係と評価上の課題があります:

  • Dependency on Teacher Models: 現在、最も効果的なsCMは、初期化と蒸留の両方に事前学習された拡散モデルに依存しています。
  • Quality Gap: sCMとその教師拡散モデル間には、わずかですが一貫したサンプル品質のギャップが残ります。
  • Metric Limitations: OpenAIは、FIDスコアが実際に知覚されるサンプル品質を必ずしも完全に反映しないことを指摘しており、特定のアプリケーション要件に応じてsCMの品質評価方法を変える必要があるかもしれません。

Sources