Google DeepMind 去耦合 DiLoCo

Google DeepMind 去耦合 DiLoCo

Google DeepMind 已宣布 去耦合 DiLoCo(分布式低通信),这是一种新的分布式架构,旨在地理上遥远的数据中心之间训练大型语言模型(LLM)。通过将训练运行解耦为异步的“计算岛屿”,该系统隔离了硬件故障,并消除了传统紧耦合同步所带来的通信瓶颈。

异步训练和硬件韧性

去耦合 DiLoCo 使用异步数据流使得训练可以跨越独立的计算岛屿进行,这些岛屿被称为学习单元。这种架构可以防止某个地区的芯片故障中断其他学习单元的进展,使得系统相比传统方法具有显著更高的容错能力。

关键韧性特性包括:

  • 自愈基础设施:系统可以在整个学习单元丢失后继续训练,并在它们重新上线时无缝重新集成。
  • 混沌工程验证:Google DeepMind 使用人工硬件故障来验证,相比传统训练方法,该系统在故障期间能够保持更高的学习集群可用性。
  • 机器学习性能相当:使用 Gemma 4 模型的测试表明,去耦合 DiLoCo 提供的基准机器学习性能与传统训练方法相同,尽管其对硬件故障的容错能力有所提升。

低带宽、全球规模预训练

去耦合 DiLoCo 专为在广域网(WAN)上的生产级预训练而设计,避免了计算单元必须等待同步而产生的“阻塞”瓶颈。

在一次真实世界的实验中,Google DeepMind 在四个独立的美国地区训练了一个 120亿参数的模型。技术结果包括:

  • 网络需求:训练使用了 2-5 Gbps 的广域网络,这一带宽水平可以通过数据中心之间现有的互联网连接实现。
  • 速度提升:通过将通信融入更长的计算周期,该系统的训练速度比传统同步方法快超过 20倍。
  • 带宽效率:该架构所需的带宽比传统训练方法少几个数量级。

支持异构硬件

该架构允许在单次训练运行中混合不同代的硬件,这增加了总的可用计算资源并延长了硬件的生命周期。

Google DeepMind 展示了混合不同代的芯片——具体来说是 TPU v6e 和 TPU v5p——在不同速度下运行时,仍能匹配单一芯片类型训练运行的机器学习性能。此能力缓解了由于新硬件代码在不同设施间分阶段推出而导致的物流瓶颈。

Sources