OpenAI AI 与效率分析

OpenAI 发布了一项分析,表明自 2012 年以来,在 ImageNet 分类任务上将神经网络训练到特定性能水平所需的计算量每 16 个月就会减少一半。这一趋势表明,算法进步带来的效率提升比单纯的硬件改进更为显著。

算法效率趋势

算法效率被定义为训练特定能力所需的计算量减少。通过保持性能不变,OpenAI 观察到在多个领域实现最先进(SOTA)结果所需的资源显著减少:

  • ImageNet 分类: 与 2012 年相比,现在训练神经网络达到 AlexNet 水平所需的计算量减少了 44 倍。对于 ResNet-50 水平的性能,效率翻倍的时间大约为 17 个月。
  • 机器翻译: Transformer 架构在三年后使用少 61 倍的训练计算量,在英法翻译(WMT’14)任务上超越了 seq2seq 的性能。
  • 游戏 AI: 据估计,AlphaZero 在一年内达到 AlphaGoZero 水平性能所需的计算量减少了 8 倍。OpenAI Five Rerun 在三个月内超越原始 OpenAI Five 所需的训练计算量减少了 5 倍。

OpenAI 将这种进步描述为一种“tick tock”模型:新能力的出现(“tick”)通常需要巨大的计算支出,随后是经过改进的版本(“tock”)通过流程改进变得在部署时显著更加高效。

与硬件效率的比较

虽然摩尔定律暗示了美元/flop 的持续 2 年翻倍时间,但观察到的算法收益已超过了这一速度。具体而言,对于 AlexNet 性能基准,计算效率的 44 倍提升超过了摩尔定律在同一时期内可能带来的 11 倍提升。

OpenAI 指出,硬件和算法效率的提升是相乘的。一个全面的 AI 进步模型必须整合两者,才能准确预测随着时间推移 AI 能力部署的成本。

AI 进步的其他指标

除了训练效率外,OpenAI 还确定了算法进步的几个其他关键衡量标准:

  • 样本效率 (Sample Efficiency): 对于低数据量情况下的任务至关重要。
  • 训练速度 (Training Speed): 衡量学习能力的可并行化程度。
  • 推理效率 (Inference Efficiency): 以 GPU 时间、参数量和 flops 为衡量标准。例如,ShuffleNet 在五年内实现了 AlexNet 水平的性能,且推理效率提升了 18 倍(翻倍时间为 15 个月)。
  • 训练成本(美元): 虽然相关,但这受硬件利用率和云基础设施的影响,而不仅仅是算法进步。

分析的局限性与范围

OpenAI 承认这项研究存在若干局限性:

  • 数据稀疏性: 该分析基于少数任务中的少量数据点,因此尚不清楚这些趋势是否可以推广到所有 AI 任务。
  • 关注最终运行成本: 该分析衡量的是优化模型的最终训练运行成本,而非总开发成本(包括架构搜索和超参数调优)。
  • 概念性进步: 首次创造某种能力被视为比随后的效率提升占据了更大份额的概念性进步。
  • 无外推法: 报告呈现了结果,但并未对这些趋势的长期外推进行推测。

对 AI 政策的影响

OpenAI 建议,专注于测量和评估可以改善 AI 政策制定。具体而言,该分析表明,政策制定者应该:

  1. 增加对学术界计算资源的资金投入,以允许学术研究复制并扩展工业界的研究。
  2. 评估效率提升的速率,以建立关于 AI 能力随时间推移的成本和部署的准确直觉。

Sources