Google DeepMind 視覺對齊研究
Google DeepMind 提出了一種方法,使 AI 視覺表示與人類概念階層對齊,減少模型依賴表層特徵的傾向,並提升其泛化能力。此研究表明,重新組織模型的視覺世界內部圖譜,可使系統變得更穩健、可靠,並在少樣本學習等任務中表現更佳。
AI 與人類視覺的錯位
AI 視覺模型常常無法透過與人類相同的概念鏡頭來感知世界。雖然人類會以階層方式組織視覺資訊——認識到汽車和飛機都是大型金屬載具——AI 模型經常專注於背景顏色或紋理等表層特徵。
為了量化這個差距,研究人員使用了認知科學中的「異類挑選」任務,受試者必須辨識三張圖片中哪一張不屬於該組。研究結果顯示出系統性的錯位:在人類對答案高度一致的情況下,AI 模型常常選錯,因為它們優先考慮低層次視覺模式而非高層次概念類別。
視覺表示的三步對齊方法
直接在人類判斷資料集上微調模型常會導致過度擬合,因為資料集太小。為了克服這個問題,Google DeepMind 提出了一個三步驟流程,以在不遺失先前知識的情況下重新結構化模型表示:
- 教師模型建立:使用 THINGS 資料集,在預訓練視覺模型 (SigLIP-SO400M) 上訓練了一個小型適配器。透過凍結主要模型並對適配器進行正則化,研究人員建立了一個「教師」模型,該模型能模仿人類判斷,同時不遺忘其原始訓練。
- 合成資料集生成:此教師模型被用來生成 AligNet,這是一個龐大的資料集,包含在一百萬張不同圖片上數百萬個類似人類的異類挑選決策。
- 學生模型微調:其他 AI 模型(「學生」)使用 AligNet 資料集進行微調。此資料的多樣性防止了過度擬合,並使學生能夠深度重新結構化其內部表示圖譜。
因此,學生模型的內部圖譜從無結構的雜亂轉變為有組織的叢集,其中高層次概念(例如動物 vs. 食物)被清晰分開。
對模型性能與可靠性的影響
將 AI 表示與人類概念階層對齊,在認知和技術性能上都帶來了可量測的提升:
改進的人類對齊
對齊後的模型在異類挑選任務和多重排列任務(按相似度排列圖片)上與人類判斷的一致性顯著提高。研究人員還引入了一個名為 Levels 的新資料集,以進一步驗證這些改進。
人類般的不確定性
對齊後的模型發展出一種與人類行為相關的不確定性形式;具體來說,模型決策不確定性與人類做出選擇所需的時間強烈相關。
增強的泛化能力與穩健性
使模型更符合人類提升了其在標準 AI 基準測試中的表現,包括:
- 少樣本學習:能夠從單張圖片中學習新類別。
- 分布偏移:能夠在測試圖片類型發生變化時仍做出可靠決策。
結論
透過重新組織視覺模型的內部表示圖譜以遵循人類概念階層,Google DeepMind 證明 AI 可以變得更直觀且可信。此方法提供了一條可擴展的路徑,用於構建對表層噪聲更具穩健性、且能在多樣化視覺環境中更好泛化的視覺系統。