簡化、穩定與擴展連續時間一致性模型

OpenAI 推出 sCM,一種全新的連續時間一致性模型方法,僅需兩個抽樣步驟即可產生高品質樣本。與傳統擴散模型相比,該方法在實際時鐘時間上提升約 50 倍,同時保持相當的樣本品質。

透過 sCM 加速抽樣

sCM 透過直接將噪聲轉換為無噪聲樣本,大幅降低生成式 AI 的計算負擔。傳統的擴散模型需要數十甚至數百個連續去噪步驟才能產生單張圖像,而 sCM 則設計為繞過此漸進過程。

最大 sCM 模型(15 億參數)的關鍵效能指標包括:

  • 抽樣速度: 在單顆 A100 GPU 上(未進行推論優化)生成單個樣本僅需 0.11 秒。
  • 效率: 使用的有效抽樣計算量不到其他最先進生成模型所需的 10%,即可達到相似的 Fréchet Inception Distance(FID)分數。
  • 步驟減少: 僅使用兩個抽樣步驟即可達到與領先擴散模型相當的品質。

技術實作與擴展

sCM 簡化了連續時間一致性模型的理論公式,從而穩定了訓練過程,並使模型能夠擴展至更大的資料集與參數規模。OpenAI 將 sCM 的訓練規模擴展至 15 億參數,使用 ImageNet 並在 512×512 解析度下進行。

知識蒸餾

sCM 方法從預訓練的教師擴散模型中蒸餾知識。OpenAI 的研究顯示,隨著教師擴散模型規模的提升,sCM 也會成比例地改進。樣本品質的相對差異(以 FID 分數比率衡量)在模型規模跨越數個量級時保持一致,這意味著隨著模型擴大,絕對品質差距會縮小。

品質與步驟

將抽樣步驟數量提升至兩步以上,會進一步縮小 sCM 與教師擴散模型之間的品質差距。即使在兩步的情況下,與通常需要數百步的教師模型相比,FID 分數的相對差異也低於 10%。

限制與約束

儘管速度提升顯著,sCM 仍存在特定的技術依賴與評估挑戰:

  • 依賴教師模型: 目前最有效的 sCM 仍需依賴預訓練的擴散模型作為初始化與蒸餾的基礎。
  • 品質差距: sCM 與其教師擴散模型之間仍存在小但持續的樣本品質差距。
  • 指標限制: OpenAI 指出,FID 分數並不總是能完美反映實際感知的樣本品質,這暗示在不同應用需求下,sCM 的品質可能需要以其他方式評估。

Sources