DALL·E 2 预训练缓解措施

OpenAI 详细说明了在 DALL·E 2 预训练期间采用的技术缓解措施,以降低有害内容、阻止人口统计偏见的放大,并消除对训练图像的逐字复制。

通过主动学习降低有害内容

OpenAI 使用迭代的主动学习过程来改进用于从训练数据集中筛选暴力和色情内容的分类器。该过程聚焦于两个主要目标:降低误报率和降低漏报率。

降低误报率

为尽量减少良性图像被误分类为有害的频率,OpenAI 为当前模型判定为正例的图像分配了人工标签。分类阈值被调至几乎 100% 召回率,但伴随较高的误报率,从而确保人工标注者主要遇到并纠正真正的负例。

降低漏报率

为发现模型遗漏的有害图像,OpenAI 采用了最近邻搜索。该过程包括:

  1. 进行多折交叉验证,以识别在标记数据集中被模型频繁误分类为负例的正样本。
  2. 在大规模未标记图像集合中,搜索这些误分类样本在感知特征空间中的最近邻。
  3. 为发现的图像分配人工标签。

缓解数据过滤导致的偏见放大

虽然过滤训练数据可以减少显式有害内容,但也可能无意中产生或放大偏见。OpenAI 观察到,过滤后的模型比未过滤模型更具偏见;例如,提示 "a ceo" 在过滤模型中几乎只生成男性图像,而未过滤模型则生成更多女性图像。

偏见放大的原因

OpenAI 假设这种放大发生的原因包括:

  • 原始数据集中女性更常出现在性化情境中,导致过滤器移除的女性图像多于男性图像。
  • 分类器本身可能因实现或类别定义而带有偏见。

衡量过滤导致的偏见

为量化此效应,OpenAI 利用数据集的多模态特性,测量标题中关键词的出现频率。使用 Apache Spark,他们比较了过滤前后数据集中关键词(如 "woman"、"man")的频率。结果显示,例如 "woman" 的出现率下降了 14%,而 "man" 仅下降了 6%。

对数据集重新加权

为防止过滤模型的偏见程度超过未过滤模型,OpenAI 实施了一种重新加权方案,使过滤数据集的分布匹配未过滤数据集的分布。

  1. 分类器训练:在一个小型 CLIP 模型之上训练线性探针,以预测图像属于未过滤数据集的概率 ($P(\text{unfiltered}|\text{image})$)。
  2. 权重计算:为每张图像分配权重,比例为 $P(\text{unfiltered}|\text{image}) / P(\text{filtered}|\text{image})$。
  3. 应用:将该权重应用于图像的训练损失,等效于对欠代表样本进行重复训练。

微调后,"man" 和 "woman" 的相对频率下降分别从 14% 与 6% 调整为 -1% 与 1%。

消除图像复制

OpenAI 发现 DALL·E 2 的前身会逐字复制训练图像,尤其是那些在训练集中有大量近似重复的简单矢量图形。这种 "复制" 可能导致版权和隐私问题。

通过聚类进行去重

为消除该问题,OpenAI 对数据集进行去重。为避免在数亿图像数据集中比较每一对图像的计算成本,他们采用了聚类方法:

  • 聚类:对数据集进行聚类,仅在每个聚类内部执行去重。
  • 多次聚类:为处理可能跨聚类边界的重复对,OpenAI 使用了五种不同的随机聚类。该方法在测试子集上发现了 97% 的所有重复对。

对性能和复制的影响

尽管去除了近 25% 的数据集,但人工评估者略微更偏好使用去重数据训练的模型,表明冗余图像会削弱性能。

去重后,对训练数据集中的 50,000 条提示进行搜索,结果显示模型从未复制过训练图像,即使给出与图像完全对应的提示也不会出现复制现象。

Sources