Jeff Dean 論 AI 計算的未來、推論專用化與持續學習

核心論點:計算規模化與自主工程之路

在未來十年內,計算能力提升 1,000,000 倍,很可能將 AI 從被動的 token 預測轉變為自主問題解決。Jeff Dean 表示,這樣的計算規模若結合多代理工作流程與模擬環境,將使 AI 能在數天內完成複雜的工程任務——例如設計飛機或新型電腦晶片——而非數年。

克服訓練資料瓶頸

與業界認為高品質文字資料即將枯竭的觀點相反,Jeff Dean 主張透過以下幾條路徑仍有顯著的成長空間:

  • 未開發的模態: 有大量的影片資料尚未被充分用於訓練。
  • 合成資料與 RL: 強化學習 (RL) 的 rollout 可以產生高品質的合成資料。透過探索數千種程式問題的潛在解法,並篩選出能編譯且通過單元測試的解答,模型能自行建立高品質的訓練集。
  • 跨語言增強: 已驗證的程式碼(例如 Python)可作為完整的提示,生成等效且高效能的另一語言程式碼(例如 Go),從而以驗證過的行為資料增強訓練集。
  • 演算法效率: 新技術可讓模型透過多次遍歷,從現有資料中提取更多資訊。

向推論專用硬體的轉變

資料中心的機器學習工作負載正大幅轉向推論。此轉變需要從通用的訓練硬體轉向專用的推論矽晶片。

為何專用化重要

推論工作負載在多個關鍵方面與訓練不同:

  • 精度需求: 推論可在遠低於訓練的精度下運作。Dean 指出 FP4(4 位元浮點)出奇地有效,且進一步降至 2 位元或 1 位元整數並結合縮放因子也可能實現。
  • 權重穩定性: 與訓練不同,推論期間模型權重不會變動,這使得硬體可優化以能源效率與吞吐量為優先,而非彈性。
  • 量能: 代理行為與離線 RL rollout 的興起提升了推論請求的總量,需更高的每瓦效能與更低的延遲。

Google 已透過 TPU 8i 與 8t 晶片開始此轉變,這些晶片專為處理上述不同的計算特性而設計。

合併前訓練與後訓練

Jeff Dean 認為目前前訓練與後訓練之間的嚴格分離「在智識上令人不滿」,他主張採用交錯式的學習方法:

  • 主動學習: 模型不應僅被動觀察 token,而應在模擬或真實環境中採取行動,觀察結果並從中學習。
  • 持續學習循環: 理想的狀態是觀察資料並透過行動應用知識的循環。雖然在模型向使用者釋出前仍需執行安全協議與紅隊測試,但底層模型應在幕後持續學習。

解決「終身 AI」的注意力問題

要實現「終身 AI」——即能存取使用者完整數位歷史或公司完整程式碼庫的系統——產業必須突破標準注意力機制的二次成本($O(n^2)$)。

無限上下文的策略

由於完整的注意力機制對於數十億 token 而言成本過高,Dean 建議採用階層式檢索架構:

  1. 廣泛檢索: 系統從數十億文件中找出數千篇相關文件。
  2. 精細過濾: 輕量模型將其縮減至少量高度相關的片段(例如 117 項)。
  3. 高精度處理: 這些片段被放入更大、更強模型的昂貴上下文視窗中。

此編排在保持計算可行性的同時,營造出巨量上下文視窗的假象。

蒸餾與開源生態系統

知識蒸餾是將前沿能力帶入較小、較快模型的主要機制。Dean 解釋說,使較小模型(如 Flash 系列或 Gemma)幾乎與前沿模型同等效能的「魔法醬」在於使用更大、更強的模型教導較小模型的過程。

這形成共生關係:產業必須持續建構龐大且效率較低的前沿模型,專門為了將其知識蒸餾至生產環境中使用的高效「主力」模型。

大規模工程:宇宙射線與硬體故障

在 Google 規模的資料中心運營顯示硬體本質上不可靠。Dean 強調了大規模系統的幾項關鍵現實:

  • 宇宙射線: 來自遙遠超新星的阿爾法粒子可能在 DRAM 中造成單位元翻轉。Google 透過 ECC(錯誤更正碼)記憶體監測此類錯誤,並觀察到面向特定方向的叢集在某些宇宙事件期間錯誤率較高。
  • 透過軟體提升可靠性: 由於硬體會失效,Google 專注於以不可靠的零件構建可靠系統。早期的做法是建立基於軟體的校驗和系統,以處理缺乏 ECC 記憶體的消費級硬體上的資料損壞。

Sources