Google DeepMind:AlphaGo 十年影响
Google DeepMind 宣布,十年前 AlphaGo 开创的技术已经从掌握复杂游戏演进为解决基础科学挑战,并为人工通用智能(AGI)的发展提供了参考。2016 年对世界冠军 Lee Sae Dol 的胜利表明,AI 可以超越模仿人类专家,发现新颖的策略,为将搜索和强化学习应用于现实科学问题提供了路线图。
AlphaGo 的技术基础
AlphaGo 通过将深度神经网络与先进的搜索和强化学习相结合,克服了围棋的极端复杂性——其可能的局面多达 $10^{170}$ 种。系统的学习过程分为两个主要阶段:
- Supervised Learning:AlphaGo 首先通过研究人类专家的对局,学习出一个合理走法的模型。
- Reinforcement Learning:随后系统与自身对弈数十万局,强化最强的取胜策略。
为了使问题可解,AlphaGo 分析了最有潜力的路径子集,以确定最有可能导致胜利的落子。该方法在 AlphaGo Zero 中进一步完善,后者完全通过随机对弈学习;AlphaZero 则是一个通用系统,仅凭游戏规则从零开始掌握围棋、国际象棋和将棋,并击败顶尖人类选手和诸如 Stockfish 等专用程序。
从游戏到科学突破的转变
DeepMind 将 AlphaGo 证明的在庞大搜索空间中导航的能力应用于现实世界,取得了多项高影响力的科学成就:
蛋白质折叠与 AlphaFold
2020 年,DeepMind 使用 AlphaFold 2 解决了预测蛋白质三维结构这一历时 50 年的重大挑战。该系统实现了对全部 2 亿已知蛋白质结构的折叠预测,这些数据现已在开源数据库中提供,已有超过 300 万研究人员用于疟疾疫苗和分解塑料酶的研究。该工作使 John Jumper 与 Demis Hassabis 于 2024 年获得了诺贝尔化学奖。
数学推理
AlphaProof,作为 AlphaGo 架构的直接衍生,结合语言模型与 AlphaZero 的强化学习和搜索算法,以证明形式化数学命题。与 AlphaGeometry 2 一起,AlphaProof 在国际数学奥林匹克(IMO)中达到了银牌水平。随后,Gemini 的 “Deep Think” 模式的高级版本在 2025 年 IMO 中实现了金牌水平的表现。
算法发现与科学协作
- AlphaEvolve:一个由 Gemini 驱动的编码代理,探索计算机代码以寻找高效算法。它发现了一种用于矩阵乘法的新方法,而矩阵乘法是现代神经网络的核心操作。
- AI Co-scientist:一个整合搜索与推理原理的系统,使代理能够“辩论”科学假设。在伦敦帝国学院的验证研究中,它独立提出了一个关于抗菌药物耐药性的假设,而该假设原本需要人类研究者多年才能提出。
DeepMind 还利用这些技术推动了基因组、聚变能源和天气预测等领域的研究。
通往人工通用智能(AGI)的路径
DeepMind 认为,实现 AGI 的路径需要整合三大核心要素:
- World Models:类似 Gemini 的多模态系统,能够理解语言、音频、视频、图像和代码。
- Search and Planning:由 AlphaGo 和 AlphaZero 开创的推理与搜索技术。
- Specialized Tool Use:通用模型调用专用 AI 工具的能力(例如使用 AlphaFold 进行蛋白质结构预测)。
虽然 “Move 37” 展示了 AI 超出常规思考的能力,DeepMind 将真正的原创发明定义为不仅能够精通已有游戏,还能创造出像围棋一样深邃且优雅的新游戏的能力。