Anthropic 擴展可解釋性研究的工程挑戰
Anthropic 正將其可解釋性研究擴展到更大的模型,主要的瓶頸已從理論研究轉向分散式系統工程。這一轉變對於從小規模 transformer 實驗轉向分析如 Claude 3 Sonnet 等模型至關重要,研究人員已在其中識別出數千萬個「特徵」(代表語義概念的神經元組合)。
稀疏自編碼器(Sparse Autoencoders)的分散式數據洗牌
擴展稀疏自編碼器(SAEs)的訓練需要能夠對大規模的 transformer 激活值數據集進行洗牌(shuffling),以防止學習到虛假的、依賴順序的模式。雖然對於可以放入單個 GPU 的數據來說,洗牌是微不足道的,但當數據集達到 PB 級別時,這就成為了一項重大的工程挑戰。
洗牌流水線的演進
Anthropic 最初使用簡單的分散式洗牌,將數據拆分為 $K$ 個任務,每個任務對整個訓練數據集進行流式讀取,以寫入其應得的輸出份額。隨著數據集增長到 100TB(1000 億個數據點),這種方法變得低效,導致洗牌過程需要耗時數天。
為了落實這一點,Anthropic 實施了多輪次洗牌分散式方案:
- 第一輪次:$N$ 個任務各讀取數據集的 $1/N$,在本地進行洗牌,並將數據寫入 $K$ 個獨立的文件(每個文件包含 $1/NK$ 的數據)。
- 後續輪次:將每個任務產生的第一個文件進行分組,以代表最終洗牌數據的前 $1/K$ 部分。如果這些分片(shards)仍然超過內存限制,則重複此過程。
這種方法每輪次可將洗牌規模縮小 100 倍(假設內存為 100GB 且輸出文件為 1GB),使團隊能夠在四輪次內將規模從 100GB 擴展到 100PB。
特徵視覺化流水線工程
生成用於特徵視覺化的數據——這能讓研究人員看到哪些 token 激發了特定的特徵——需要處理跨越 1 億個 token 的數據集中數百萬個特徵。
分散式數據處理工作流
為了處理數百萬個特徵的規模,Anthropic 利用了分片處理流水線:
- 初始分片:系統對數據集和特徵同時進行分片。每個任務追蹤其特定特徵和數據切片中的前 $K$ 個最高激發 token 和 $10K$ 個隨機激發 token。
- 聚合:系統對特徵進行分片,以聚合前一輪次產生的結果,識別出每個特徵的全局最高激發 token。
- 上下文激發分析:為了計算一個特徵在周圍 token 上的激發情況,團隊實施了兩步流程,以避免在數據集中進行隨機讀取:
- 數據集分片輪次:每個任務處理一塊 transformer 激活值切片,並將特定特徵組所需的激活值保存到獨立的文件中。
- 特徵分片輪次:任務接著訪問這些整合的文件,以計算最終激發值並為前端視覺化工具格式化數據。
AI 安全中的研究與工程整合
Anthropic 將研究與工程視為可解釋性過程不可分割的組成部分。團隊遵循迭代循環,即只有在研究假設在較小規模的實驗中顯示出初步成功後,才會對基礎設施進行大量投入。
團隊組成與策略
可解釋性團隊由 18 名成員組成,擁有神經科學、數學、生物學、物理學、數據視覺化和軟件工程等多樣化的背景。他們的研發路線圖受 Anthropic 的負責任擴展政策(RSP)指導,該政策要求在部署具有更高能力的模型時,必須先達到特定的安全里程碑。這種探索性研究旨在直接影響這些安全里程碑,單一性(monosemanticity)的擴展能力與模型能力的擴展同步進行,確保理解模型內部的能力能隨著模型的規模擴大而同步擴展。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch