Google DeepMind:AlphaGo 十 年的影響

Google DeepMind 宣布,十年前 AlphaGo 開創的技術已從精通複雜遊戲演變為解決基礎科學挑戰,並為通用人工智慧(AGI)的發展提供了啟示。2016 年對世界冠軍 Lee Sae Dol 的勝利顯示,AI 能夠超越模仿人類專家的範疇,發掘全新策略,為將搜尋與強化學習應用於現實科學問題提供了藍圖。

AlphaGo 的技術基礎

AlphaGo 透過結合深度神經網路、先進的搜尋與強化學習,克服了圍棋的極端複雜性——其可能的局面高達 $10^{170}$ 種。系統的學習過程分為兩個主要階段:

  1. 監督式學習: AlphaGo 首先透過研究人類專家的對局,學習出合理走法的模型。
  2. 強化學習: 系統隨後與自身對弈數十萬局,強化最強的勝利策略。

為了使問題可解,AlphaGo 會分析最具潛力的子路徑子集,以找出最有可能導致勝利的走法。此方法在 AlphaGo Zero 中進一步精練,該系統完全從隨機對弈中學習;而 AlphaZero 則是一個通用系統,僅憑遊戲規則從頭掌握圍棋、國際象棋與將棋,擊敗頂尖人類玩家與專門程式(如 Stockfish)。

從遊戲到科學突破的轉變

DeepMind 將 AlphaGo 證明的巨量搜尋空間導航能力應用於現實世界,帶來多項高影響力的科學成就:

蛋白質摺疊與 AlphaFold

2020 年,DeepMind 以 AlphaFold 2 解決了預測蛋白質三維結構這一歷時 50 年的重大挑戰。該系統使得所有 2 億個已知蛋白質的結構得以摺疊,並以開源資料庫的形式提供,已有超過 300 萬名研究人員利用其開發瘧疾疫苗與分解塑膠的酵素。此成果使 John Jumper 與 Demis Hassabis 於 2024 年獲得諾貝爾化學獎。

數學推理

AlphaProof 為 AlphaGo 架構的直接衍生,結合語言模型與 AlphaZero 的強化學習與搜尋演算法,以證明形式化的數學命題。與 AlphaGeometry 2 共同達成國際數學奧林匹克(IMO)銀牌標準。其後,Gemini 的「Deep Think」模式的進階版本在 2025 年 IMO 中達到金牌等級的表現。

演算法發現與科學合作

  • AlphaEvolve: 一個由 Gemini 驅動的程式編寫代理,探索程式碼以尋找高效演算法。它發現了一種新穎的矩陣乘法方法,這是現代神經網路的核心運算。
  • AI Co-scientist: 一個結合搜尋與推理原則的系統,使代理能「辯論」科學假說。於倫敦帝國學院的驗證研究中,它獨立提出了一項關於抗菌藥物抗藥性的假說,該假說原本需要人類研究者多年才能提出。

DeepMind 亦利用這些技術推進基因組、聚變能源與天氣預測等領域的研究。

通往人工通用智慧(AGI)的道路

DeepMind 認為,通往 AGI 的道路需要整合三個核心要素:

  1. 世界模型: 如 Gemini 這類多模態系統,能理解語言、音訊、影片、影像與程式碼。
  2. 搜尋與規劃: 由 AlphaGo 與 AlphaZero 開創的推理與搜尋技術。
  3. 專用工具使用: 通用模型能調用專門的 AI 工具(例如使用 AlphaFold 進行蛋白質結構預測)。

雖然「第 37 手」展示了 AI 超出框架思考的能力,DeepMind 將真正的原創發明定義為不僅能精通現有遊戲,更能創造出如圍棋般深奧且優雅的新遊戲。

Sources