DALL·E 2 預訓練緩解措施

OpenAI 詳細說明了在 DALL·E 2 預訓練期間所採用的技術緩解措施,以減少有害內容、防止人口統計偏見的放大,並消除訓練圖像的逐字複製。

透過主動學習減少有害內容

OpenAI 使用了迭代式的主動學習流程,提升用於從訓練資料集中過濾暴力與性內容的分類器。此流程聚焦於兩個主要目標:減少偽陽性與減少偽陰性。

減少偽陽性

為了降低良性圖像被誤判為有害的頻率,OpenAI 為目前模型標記為正面的圖像分配了人工標籤。分類閾值被調整為接近 100% 的召回率,但偽陽性率較高,確保人工標註者主要接觸並修正真正的負面案例。

減少偽陰性

為了找出模型遺漏的有害圖像,OpenAI 採用了最近鄰搜尋。此流程包括:

  1. 進行多次交叉驗證,以識別在標記資料集中被模型頻繁誤判為負面的正樣本。
  2. 在感知特徵空間中,掃描大量未標記圖像,尋找這些誤判樣本的最近鄰。
  3. 為發現的圖像分配人工標籤。

緩解資料過濾所導致的偏見放大

雖然過濾訓練資料可以減少明顯的內容,但也可能無意間產生或放大偏見。OpenAI 發現,過濾後的模型比未過濾的模型更具偏見;例如,提示「a ceo」在過濾模型中幾乎只產生男性圖像,而未過濾模型則產生較多女性圖像。

偏見放大的原因

OpenAI 假設此放大現象的原因包括:

  • 原始資料集中女性可能較常出現在性化情境中,導致過濾器移除的女性圖像多於男性圖像。
  • 分類器本身可能因實作或類別定義而帶有偏見。

測量過濾引起的偏見

為了量化此效應,OpenAI 利用資料集的多模態特性,測量說明文字中關鍵字的出現頻率。使用 Apache Spark,他們比較了過濾與未過濾資料集中關鍵字(例如「woman」「man」)的頻率。結果顯示,例如「woman」的出現率下降了 14%,而「man」僅下降了 6%。

重新加權資料集

為了防止過濾模型的偏見程度超過未過濾模型,OpenAI 實施了一套重新加權機制,使過濾資料集的分佈與未過濾資料集相匹配。

  1. Classifier Training:在一個小型 CLIP 模型之上訓練線性探測器,以預測圖像屬於未過濾資料集的機率 ($P(\text{unfiltered}|\text{image})$)。
  2. Weight Calculation:根據比例 $P(\text{unfiltered}|\text{image}) / P(\text{filtered}|\text{image})$ 為每張圖像分配權重。
  3. Application:將此權重套用於圖像的訓練損失,等效於重複使用代表性不足的樣本。

微調後,「man」與「woman」的相對頻率下降分別從 14% 與 6% 變為 -1% 與 1%。

消除圖像重複生成

OpenAI 發現了一個問題,即 DALL·E 2 的前身會逐字複製訓練圖像,尤其是簡單的向量圖形,這些圖形在訓練集中有許多近似重複。此「重複生成」可能引發版權與隱私問題。

透過聚類去重

為了消除這個問題,OpenAI 對資料集進行了去重。為避免在數億圖像的資料集中比較每對圖像所帶來的計算成本,他們採用了聚類方法:

  • Clustering:將資料集進行聚類,僅在每個聚類內執行去重。
  • Multiple Clusterings:為了處理可能跨聚類邊界的重複對,OpenAI 使用了五種不同的隨機聚類。此方法在測試子集上發現了 97% 的所有重複對。

對效能與重複生成的影響

儘管移除了近 25% 的資料集,人工評估者仍稍微偏好使用去重資料訓練的模型,顯示冗餘圖像會妨礙效能。

去重後,對訓練資料集中的 50,000 個提示進行搜尋,結果顯示模型從未重複生成訓練圖像,即使給予與圖像完全相同的提示亦如此。

Sources