OpenAI AI 與運算分析

AI 運算的指數增長

自 2012 年起,用於最大規模 AI 訓練的運算量呈指數增長,平均每 3.4 個月翻倍。這一增長速率遠高於摩爾定律,後者歷史上約每兩年翻倍一次。自 2012 年以來,該指標增長了超過 300,000 倍,而若遵循摩爾定律的翻倍週期,僅會增加約 7 倍。

OpenAI 指出,運算能力的提升是 AI 進步的關鍵因素,並建議產業應為具備遠超目前可用水平的系統所帶來的影響做好準備。

AI 運算的歷史時代

對 1959 年至 2012 年資料的分析揭示了 AI 訓練運算使用的兩個不同時代:

  1. 第一時代(1959–2012): AI 成果大致與摩爾定律的增長同步。
  2. 現代時代(2012–至今): AI 訓練運算已大幅超越硬體增長的宏觀趨勢。

值得注意的是,無論是「AI 冬天」還是熱潮時期,運算使用的趨勢始終保持一致,這表明過去半個世紀的投資與炒作循環對實際用於訓練學習系統的計算能力影響甚微。

計算運算量的估算方法

OpenAI 使用了兩種主要方法來估算訓練知名 AI 成果所使用的總運算量,單位為 petaflop/s-days(pfs-days)。

方法一:計算操作次數

此方法直接計算每個訓練樣本在所描述的架構中執行的浮點運算(FLOPs)——具體為加法與乘法——的次數,然後乘以訓練期間前向與反向傳播的總次數。當架構與訓練細節全部公開時,會採用此方法。

方法二:GPU 訓練時間

當無法取得直接的操作次數時,OpenAI 會根據使用的 GPU 數量、訓練時長以及假設的利用效率來估算運算量。標準假設如下:

  • GPU 利用率: 33% (0.33)
  • CPU 利用率: 17% (0.17)

OpenAI 表示,這些計算並非旨在精確,而是希望在 2–3 倍的範圍內正確,重點在於量級的估計。

知名 AI 成果的運算需求

雖然大規模運算不是每項重要突破的必要條件,OpenAI 仍指出有數個值得注意的成果是以相對 modest 的運算量完成的:

  • Attention is all you need (Transformer): 0.089 pfs-days
  • Adam Optimizer: < 0.0007 pfs-days
  • Learning to Align and Translate: 0.018 pfs-days
  • GANs: < 0.006 pfs-days
  • Word2Vec: < 0.00045 pfs-days
  • Variational Auto Encoders: < 0.0000055 pfs-days

Sources