斯坦福 CME296 第7讲:文本到图像生成模型的评估
评估文本到图像生成模型的输出是开发生命周期中的关键步骤,因为改进需要一种可靠的方式来量化质量。评估通常分为两个主要维度:美学(图像是否在物理上合理且视觉上令人愉悦)和提示遵循性(图像是否准确反映输入文本中指定的对象、风格和位置)。
基于人类的评估
人工评分提供了最细致的反馈,但噪声大且成本高。本讲识别了三种主要的人类评估设置:
- 绝对尺度(1-5): 用户在尺度上为图像打分。这种方式细致但噪声大,因为不同的人对尺度的解释不同。
- 二元通过率: 用户判断图像是“好”还是“坏”。这种方式对人类更容易,但缺乏绝对质量的参考点。
- 两两比较: 用户比较两幅图像并选择更好的那一幅。这是噪声最小的方法,因为相对比较比绝对评分更直观。
Elo 评级系统
为了避免在排行榜中将每个模型与其他所有模型进行比较所带来的计算和人工成本,使用了 Elo 评级系统。Elo 不仅仅使用简单的胜率,而是根据对手的实力来调整模型的评分。如果模型击败强大的对手,其评分会显著提升;击败弱小的对手则只会获得微小提升。这使得排行榜能够动态更新,新模型可以在无需重新评估全部模型的情况下加入。
无参考指标
无参考指标在不将生成图像与单一“真实”图像比较的情况下评估图像,因为针对同一提示可能存在多张有效图像。
Fréchet Inception Distance(FID)
FID 是衡量美学和多样性的行业标准。它在潜在空间中(具体使用 Inception 网络编码器)比较生成图像的分布与真实图像的分布。
- 机制: 它计算两个高斯分布之间的 Wasserstein 距离,这些分布由其均值 ($\mu$) 和协方差 ($\Sigma$) 描述。
- 解释: 较低的 FID 分数表明生成分布更接近真实分布。均值的差异暗示风格/质量差距,而协方差的差异则表明缺乏多样性(模式崩溃)。
- 局限性: FID 假设分布为高斯分布,但在实际中很少成立,并且它可能是对实际人类感知质量的较差代理。
提示遵循性指标
- CLIPScore: 使用 CLIP 模型测量输入文本和生成图像的嵌入之间的余弦相似度。它在一般语义匹配上有效,但在细微的空间或关系细节上表现不足。
- PickScore: 一种基于 CLIP 的模型,专门在人工偏好数据上进行训练,以提供结合美学和遵循性的整体评分。
基于参考的指标
基于参考的指标在存在特定目标图像时使用,例如在 VAE 重建或图像编辑任务中。
- MSE(均方误差): 像素级距离。对细微的对齐偏移非常敏感。
- PSNR(峰值信噪比): 相对于最大可能像素值对 MSE 进行归一化,并使用对数以更好地符合人类对误差的感知。
- SSIM(结构相似性指数): 超越像素层面,基于亮度、对比度和结构(使用 Pearson 相关)比较局部块。比 MSE 更稳健,但对大幅位移仍然敏感。
- LPIPS(学习感知图像块相似度): 将图像通过预训练编码器(如 VGG 或 AlexNet)并计算特征图之间的加权距离。此方法旨在与人类感知判断高度一致。
MLLM 作为评审
多模态大语言模型(MLLM)越来越多地被用作评审,因为它们能够提供推理(理由),而不仅仅是标量分数。
MLLM 评估的演进
- TIFA(文本到图像忠实度评估): 将提示拆解为原子级的是/否问题(例如,“有泰迪熊吗?”)。MLLM 对每个问题作答,最终分数为正确答案的比例。这可以精确定位模型失效的具体位置。
- VQA 分数: 将评估形式化为视觉问答任务(例如,“此图是否展示了[提示]?”)。分数为模型对“yes”标记分配的概率。
- VIEScore(视觉指令引导可解释分数): 采用概念中心的方法,评审获得详细的评分标准(例如“感知质量”指南),并在给出最终分数前提供理由,通常以 JSON 输出以便于解析。
MLLM 评审的最佳实践
- 思路链: 要求模型在给出分数之前先输出推理过程,以提升准确性。
- 确定性: 将 temperature 设置为零,以确保每次运行结果一致。
- 偏差缓解: 在两两比较时,交换图像顺序以防止位置偏差。
- 对齐: 通过将 MLLM 评审的评分与人工评分样本进行比较,并相应调整评分标准,以实现校准。
技术基准
多个基准针对图像生成的特定失效模式:
- GenEval: 使用目标检测模型作为评审,测试对象计数、颜色归属和相对位置。
- DPG Bench: 使用逻辑图评估密集提示,先检查前置条件(例如对象是否存在),再检查其属性。
- Long Text Bench: 专门评估 OCR 能力——模型在图像中渲染可读、准确文本的能力。
- Grounded Edits Bench: 基于感知质量和语义一致性评估图像编辑任务。