# Google DeepMind 解耦 DiLoCo
Google DeepMind 解耦 DiLoCo
Google DeepMind 推出了解耦 DiLoCo,一種分散式訓練架構,能夠在低頻寬且使用混合硬體世代的情況下,實現跨遙遠資料中心的彈性、非同步 LLM 訓練。
非同步訓練與硬體韌性
解耦 DiLoCo 透過非同步資料流,使訓練能夠跨越獨立的計算島嶼(稱為學習單元)進行。此架構可防止某一地區的晶片故障中斷其他學習單元的進展,使系統相較於傳統方法具備顯著更高的容錯能力。
主要的韌性特徵包括:
- 自愈基礎設施:系統在整個學習單元遺失後仍能繼續訓練,並在該單元重新上線時無縫重新整合。
- 混沌工程驗證:Google DeepMind 透過人為硬體故障來驗證,該系統在故障期間相比傳統訓練方法能維持更高的學習叢集可用性。
- ML 效能對等:使用 Gemma 4 模型進行的測試顯示,解耦 DiLoCo 在提升硬體故障容忍度的同時,仍能提供與傳統訓練方法相同的基準機器學習效能。
低頻寬、全球規模預訓練
解耦 DiLoCo 專為跨廣域網路(WAN)的生產級預訓練而設計,避免了計算單元必須等待同步而產生的「阻塞」瓶頸。
在真實世界的實驗中,Google DeepMind 在四個獨立的美國地區訓練了一個 120 億參數的模型。技術結果包括:
- 網路需求:訓練使用了 2–5 Gbps 的廣域網路,這種頻寬水平可透過現有的資料中心間網際網路連線達成。
- 速度提升:透過將通訊納入較長的計算期間,系統的訓練速度比傳統同步方法快超過 20 倍。
- 頻寬效能:該架構所需的頻寬僅為傳統訓練方法的數個數量級。
支援異質硬體
該架構允許在單次訓練運行中混合不同世代的硬體,這樣可以提升可用的總計算資源並延長硬體生命週期。
Google DeepMind 展示了混合不同世代的晶片(具體而言是 TPU v6e 與 TPU v5p),即使它們運行速度不同,仍能達到與單一晶片類型訓練相同的 ML 效能。此能力可緩解因新硬體世代在不同設施間錯落推出所造成的物流瓶頸。