CLIP 中的多模態神經元
OpenAI 在 CLIP 模型中發現了「多模態神經元」,無論概念是以寫實圖像、素描還是文字形式呈現,這些神經元都會對單一概念產生反應。這項發現表明 CLIP 利用了一種與人類大腦相似的抽象機制,解釋了其對同一物體的各種視覺呈現進行分類的能力。
多模態神經元與語義不變性
CLIP 包含對語義概念群組而非特定視覺特徵產生反應的神經元。這反映了生物學上的發現,例如人類大腦中的「Halle Berry」神經元,無論是照片、素描還是該女演員的名字,都會觸發該神經元。
在 CLIP 中,OpenAI 識別出一個「Spider-Man」神經元(CLIP RN50x4 倒數第二層中的 Neuron 244)會對以下內容進行激活:
- Spider-Man 穿著制服的寫實圖像。
- 實際蜘蛛的圖像。
- Spider-Man 的漫畫插圖。
- 文字「spider」。
透過特徵視覺化和數據集範例,研究人員發現 CLIP RN50x4 中的大多數神經元都是可解釋的,並且作為「多面神經元」運作,在高度抽象的層面上對多個不同的案例產生反應。這些包括情緒、動物、名人、藝術風格,甚至數位修改的內容。
組成與分類
CLIP 透過組合這些高層次的多模態神經元來執行分類。一個稀疏線性探針(sparse linear probe)顯示,最終的分類通常是結合了幾個概念神經元後的結果。
- 視覺組成: 「存錢筒」的分類是透過結合「finance」神經元和「porcelain」神經元來實現的。同樣,「Spider-Man」神經元也有助於「barn spider」的分類。
- 文字組成: 對於語言,概念的行為幾乎是線性的。例如,模型將「surprised」一詞解釋為「shock」和「celebration/hug」的組合。
然而,這種簡化方法可能會導致遺漏。模型對「intimate」的理解涉及「soft smile」和「hearts」,但會明確地減去「illness」,因此無法解釋生病背景下的親密感。
「缺失概念」問題
並非 CLIP 的所有能力都由單個、可解釋的神經元代表。雖然 CLIP 可以執行精確的地理定位(精確到舊金山的「Twin Peaks」等特定社區),但研究人員無法找到特定的「San Francisco」神經元。這表明某些資訊是以方向或複雜流形(manifold)的形式編碼,而非離散的神經元。
弱點:字體攻擊
模型對高層次抽象的依賴創造了一種新的攻擊向量,稱為「字體攻擊」(typographic attacks)。因為 CLIP 的多模態神經元在字面與圖標表示之間具有泛化能力,因此它們可能會被文字圖像觸發。
例如,「finance」神經元會對存錢筒和文字「$$$" 產生反應。透過在 Standard Poodle 的圖像中加入字串 "$"$"$",模型可能會被誤導將該狗分類為存錢筒。這些攻擊是實際可行的,並且可以透過在實體物體上書寫文字來執行。
偏見與過度泛化
CLIP 繼承了來自互聯網規模的訓練數據中的偏見,這些偏見在神經元中表現為問題性的關聯:
- 區域偏見: 「Middle East」神經元與恐怖主義相關聯,而「immigration」神經元對拉丁美洲產生反應。
- 表徵性傷害: 研究發現一個神經元會同時對大猩猩和深色皮膚的人產生反應。
- 解析度差異: 美國和印度等國家的神經元定義明確,而非洲國家的神經元往往對整個區域而非特定國家產生反應。
OpenAI 建議,實踐者在部署前使用可解釋性工具對於預防這些偏見至關重要,因為這些偏見可能很難透過標準測試來預測或衡量。
研究工具與模型釋出
為了促進對多模態系統的進一步研究,OpenAI 已釋出 CLIP RN50x4 和 RN101 的權重。此外,OpenAI Microscope 目錄已更新,以包含 CLIP RN50x4 中每個神經元 的特徵視覺化、數據集範例和文字特徵視覺化。