OpenAI AI 與效率分析

OpenAI 發布了一項分析,顯示自 2012 年以來,在 ImageNet 分類任務上將神經網路訓練至特定性能水平所需的計算量,每 16 個月就會減少一半。這一趨勢表明,演算法的進步所帶來的效率提升,比單純的硬體改進更為顯著。

演算法效率趨勢

演算法效率被定義為訓練特定能力所需的計算量減少。在保持性能不變的情況下,OpenAI 觀察到在多個領域中,為了達到尖端(SOTA)結果所需的資源都有顯著減少:

  • ImageNet 分類: 與 2012 年相比,現在訓練神經網路達到 AlexNet 水平所需的計算量減少了 44 倍。對於 ResNet-50 水平的性能,效率翻倍的時間大約是 17 個月。
  • 機器翻譯: Transformer 架構在三年後,使用減少 61 倍的訓練計算量,就在英法翻譯(WMT’14)上超越了 seq2seq 的性能。
  • 遊戲 AI: 據估計,AlphaZero 在一年內達到 AlphaGoZero 水平性能所需的計算量減少了 8 倍。OpenAI Five Rerun 在三個月內超越原始的 OpenAI Five,所需的訓練計算量減少了 5 倍。

OpenAI 將這種進步描述為一種「tick tock」模型:新能力的出現(「tick」)通常需要龐大的計算支出,隨後是經過優化的版本(「tock」),透過流程改進,這些版本在部署時會變得顯著地更有效率。

與硬體效率的比較

雖然摩爾定律(Moore’s Law)建議美元/flop 的成本每 2 年會翻倍一次,但觀察到的演算法增益已超越了這一速度。具體而言,對於 AlexNet 性能基準測試,計算效率提升的 44 倍超過了摩爾定律在相同期間內所能提供的 11 倍提升。

OpenAI 指出,硬體與演算法的效率增益是相乘的。一個全面的 AI 進步模型必須整合兩者,才能準確預測隨著時間推移,部署 AI 能力的成本。

其他 AI 進步的指標

除了訓練效率之外,OpenAI 還確定了幾項其他關鍵的演算法進步衡量標準:

  • 樣本效率(Sample Efficiency): 對於低數據量情境下的任務至關重要。
  • 訓練速度(Training Speed): 衡量學習能力的可並行化程度。
  • 推理效率(Inference Efficiency): 以 GPU 時間、參數和 flops 為衡量標準。例如,ShuffleNet 在五年內實現了 AlexNet 水平的性能,且推理效率提升了 18 倍(翻倍時間為 15 個月)。
  • 訓練成本(以美元計): 雖然與效率相關,但這受到硬體利用率和雲端基礎設施的影響,而不僅僅是演算法的進步。

分析的局限性與範圍

OpenAI 承認這項研究中有幾項局限性:

  • 數據稀疏性: 該分析是基於少數任務中的少量數據點,因此尚不清楚這些趨勢是否能推廣到所有 AI 任務。
  • 專注於最終運行(Final Run): 該分析衡量的是優化模型最終訓練運行的成本,而非總體開發成本(包括架構搜索和超參數調整)。
  • 概念性進步: 首次創造某種能力被視為比隨後的效率提升佔有更大的概念性進步比例。
  • 不進行外推: 報告呈現了結果,但並未對這些趨勢的長期外推進行推測。

對 AI 政策的啟示

OpenAI 建議,專注於衡量與評估可以改善 AI 政策制定。具體而言,該分析指出,政策制定者應該:

  1. 增加對學術計算資源的資助,以允許學術研究能夠複製並擴展產業研究。
  2. 評估效率提升的速率,以開發對於隨著時間推移,部署 AI 能力的成本與部署情況的準確直覺。

Sources