OpenAI Activation Atlases

OpenAI 與 Google 研究人員合作開發了 Activation Atlases,這是一種用於視覺化神經網路中神經元之間交互作用的技術。這種方法讓研究人員能夠超越單個神經元的研究,進而理解多個神經元的共同表示空間,提供了一種窺探 AI 決策過程「黑盒」的方法。

Mapping Neural Interactions

Activation atlases 擴展了現有的特徵視覺化技術。早期的研究主要集中在單個神經元代表什麼,而 activation atlases 則收集並視覺化數十萬個神經元交互作用的範例。這種轉變使得視覺化這些神經元共同表示的共享空間成為可能,從而提供對網路內部表示更全面的視圖。

Improving AI Auditability and Safety

理解神經網路的內部機制對於審計模型並確保在高風險部署中的安全性至關重要。與開發人員可以審查程式碼路徑或進行形式驗證的傳統軟體不同,神經網路缺乏類似程度的透明度。Activation atlases 解決了這個問題,讓人類能夠識別:

  • Spurious Correlations: 識別網路依賴非因果相關性來分類圖像的實例。
  • Feature Overloading: 發現單個特徵在兩個不同類別中的重複使用如何導致錯誤。
  • Model Vulnerabilities: 使人類能夠基於對其內部邏輯的理解來設計攻擊以欺騙模型。

Case Study: Frying Pans vs. Woks

為了展示 activation atlases 的效用,研究人員建立了一個特定的 atlas 來分析網路如何區分煎鍋與炒鍋。分析顯示,雖然網路正確識別了物理差異(例如煎鍋較方,而炒鍋較圓且較深),但它也依賴於一種虛假相關性:麵條的存在。

研究人員發現,在圖像角落添加麵條可以使模型在 45% 的情況下誤將對象分類為炒鍋。其他由人類設計的、針對特徵檢測器過載的攻擊甚至更有效,成功率高達 93%。這個例子突顯了模型如何捕捉非因果的相關性,這種模式反映了對 AI 系統公平性與偏見的擔憂。

Implications for Interpretability

Activation atlases 的成功表明,神經網路的激活值(activations)對人類來說是有意義的。這一發現增加了人們對視覺模型實現強大可解釋性的樂觀情緒,潛在於將 AI 系統從不透明的「黑盒」轉向透明、可審計的系統。

Sources