Anthropic 可解释性扩展中的工程挑战

Anthropic 正在将其可解释性研究扩展到更大的模型,主要的瓶颈已从理论研究转向分布式系统工程。这一转变对于从小型 Transformer 实验转向分析像 Claude 3 Sonnet 这样的模型至关重要,研究人员已在这些模型中识别出了数千万个“特征”(代表语义概念的神经元组合)。

用于稀疏自编码器的分布式数据洗牌

扩展稀疏自编码器(SAEs)的训练需要能够对海量的 Transformer 激活值数据集进行洗牌(shuffling),以防止学习到虚假的、依赖于顺序的模式。虽然对于可以放入单个 GPU 的数据,洗牌是微不足道的,但当数据集达到 PB 级规模时,它就变成了一个重大的工程挑战。

洗牌流水线的演进

Anthropic 最初使用简单的分布式洗牌,即将数据分为 $K$ 个任务,每个任务对整个训练数据集进行流式读取,以写入其应得的部分输出。随着数据集增长到 100TB(1000 亿个数据点),这种方法变得低效,导致洗牌过程需要耗时数天。

为了解决这个问题,Anthropic 实施了多轮次(multi-pass)分布式洗牌:

  1. 第一轮次:$N$ 个任务每个读取数据集的 $1/N$,在本地进行洗牌,并将数据写入 $K$ 个独立的文件(每个文件包含 $1/NK$ 的数据)。
  2. 后续轮次:将每个任务产生的第一批文件组合在一起,以代表最终洗牌后数据的头 $1/K$ 部分。如果这些分片(shards)仍然超过内存限制,则重复该过程。

这种方法每轮次可将洗牌规模缩小 100 倍(假设内存为 100GB,输出文件为 1GB),使团队能够通过四轮次处理将规模从 100GB 扩展到 100PB。

特征可视化流水线工程

生成特征可视化的数据——这能让研究人员看到哪些 token 能够最强地激活特定特征——需要处理跨越 1 亿个 token 的数据集中的数百万个特征。

分布式数据处理工作流

为了处理数百万个特征的规模,Anthropic 利用了分片处理流水线:

  • 初始分片:系统在数据集和特征维度上同时进行分片。每个任务跟踪其特定特征和数据切片中的前 $K$ 个激活值最高的 token 以及 $10K$ 个随机激活的 token。
  • 聚合:系统在特征维度上进行分片,以聚合上一轮次的结果,从而识别出每个特征的全局最高激活 token。
  • 上下文激活分析:为了计算一个特征在周围 token 上的激活情况,团队实施了一个两步走的过程,以避免在数据集中进行随机读取:
    • 数据集分片轮次:每个任务处理一部分 Transformer 激活值,并将特定特征组所需的激活值保存到单独的文件中。
    • 特征分片轮次:任务随后访问这些整合后的文件,以计算最终的激活值并为前端可视化工具格式化数据。

AI 安全中的研究与工程的结合

Anthropic 将研究与工程视为可解释性过程不可分割的组成部分。团队遵循一个迭代循环,即只有在研究假设在较小规模的实验中显示出初步成功后,才会对基础设施进行大量投入。

团队组成与策略

可解释性团队由 18 名成员组成,背景涵盖了神经科学、数学、生物学、物理学、数据可视化和软件工程。他们的研究路线图受 Anthropic 的《责任扩展政策》(RSP)指导,该政策要求在部署具有更高能力的模型之前,必须达到特定的安全里程碑。这种探索性研究旨在直接影响这些安全里程碑,确保理解模型内部机制的能力能够随模型能力的提升而同步扩展。

Sources

相关