简化、稳定并扩展连续时间一致性模型
OpenAI 推出了 sCM,这是一种新的连续时间一致性模型方法,能够仅通过两步采样生成高质量样本。与传统扩散模型相比,该方法在实际运行时间上实现约 50 倍的加速,同时保持相当的样本质量。
通过 sCM 加速采样
sCM 显著降低了生成式 AI 的计算开销,通过直接将噪声转换为无噪声样本实现。传统扩散模型需要数十甚至数百个连续的去噪步骤才能生成单张图像,而 sCM 旨在跳过这一渐进过程。
最大 sCM 模型(15 亿参数)的关键性能指标包括:
- 采样速度: 在单个 A100 GPU 上(未进行推理优化)生成单个样本仅需 0.11 秒。
- 效率: 使用的有效采样计算量不到其他最先进生成模型的 10%,即可实现相似的 Fréchet Inception Distance(FID)得分。
- 步数减少: 仅使用两步采样即可达到与领先扩散模型相当的质量。
技术实现与扩展
sCM 简化了连续时间一致性模型的理论表述,从而稳定了训练过程,并使模型能够扩展到更大的数据集和参数规模。OpenAI 将 sCM 的训练规模扩展至 15 亿参数,在 ImageNet 上使用 512×512 分辨率进行训练。
知识蒸馏
sCM 方法从预训练的教师扩散模型中蒸馏知识。OpenAI 的研究表明,随着教师扩散模型规模的提升,sCM 也会相应提升。样本质量的相对差异(通过 FID 分数的比率衡量)在多个数量级的模型规模上保持一致,这意味着随着模型规模的扩大,绝对质量差距会逐渐缩小。
质量与步数
将采样步数增加到两步以上可以进一步缩小 sCM 与教师扩散模型之间的质量差距。即使在两步采样时,sCM 的 FID 分数相对教师模型的差异也不足 10%,而教师模型通常需要数百步才能完成采样。
限制与约束
尽管速度提升显著,sCM 仍面临一些技术依赖和评估挑战:
- 对教师模型的依赖: 目前最有效的 sCM 仍然依赖预训练的扩散模型进行初始化和蒸馏。
- 质量差距: sCM 与其教师扩散模型之间仍存在小但持续的样本质量差距。
- 度量限制: OpenAI 指出,FID 得分并不总能完美反映实际感知的样本质量,这意味着 sCM 的质量可能需要根据具体应用需求采用不同的评估方式。