Google DeepMind: AlphaGoの10年にわたるインパクト
Google DeepMindは、10年前にAlphaGoが切り開いた技術が、複雑なゲームのマスタリングから根本的な科学課題の解決へと進化し、汎用人工知能(AGI)の開発に情報を提供していると発表しました。2016年に世界チャンピオンの李世乭(Lee Sae Dol)に勝利したことは、AIが人間の専門家の模倣を超えて新たな戦略を発見できることを示し、探索と強化学習を実世界の科学問題に応用するためのロードマップを提供しました。
AlphaGoの技術的基盤
AlphaGoは、$10^{170}$もの可能な局面を持つ囲碁という極めて複雑なゲームを、深層ニューラルネットワークと高度な探索・強化学習を組み合わせることで克服しました。システムの学習プロセスは主に次の二段階で行われました。
- Supervised Learning(教師あり学習): AlphaGoはまず、人間の専門家が指した対局を研究することで、妥当な手のモデルを学習しました。
- Reinforcement Learning(強化学習): その後、システムは自ら何十万局もの対局を行い、最も強力な勝利戦略を強化しました。
ゲームを扱いやすくするため、AlphaGoは最も有望と思われる経路のサブセットを分析し、勝利につながる可能性が最も高い手を特定しました。このアプローチは AlphaGo Zero でさらに洗練され、ランダムプレイだけから学習し、AlphaZero という汎用システムへと拡張されました。AlphaZeroは囲碁、チェス、将棋をゲームのルールだけでゼロから習得し、トップヒューマンプレイヤーや専門プログラム(例: Stockfish)を打ち負かしました。
ゲームから科学的ブレークスルーへの転換
DeepMindは、AlphaGoによって実証された大規模探索空間のナビゲーション能力を物理世界に応用し、いくつかの高インパクトな科学的成果を達成しました。
タンパク質折りたたみと AlphaFold
2020年、DeepMindは AlphaFold 2 によって、3次元タンパク質構造予測という50年にわたる大課題を解決しました。このシステムは、既知の2億個のタンパク質すべての構造を折りたたむことを可能にし、オープンソースデータベースとして公開され、300万人以上の研究者がマラリアワクチンやプラスチック分解酵素の研究に利用しています。この功績により、2024年にジョン・ジャンパーとデミス・ハサビスは化学賞(ノーベル賞)を受賞しました。
数学的推論
AlphaProof は、AlphaGoのアーキテクチャを直接受け継ぎ、言語モデルと AlphaZero の強化学習・探索アルゴリズムを組み合わせて形式的な数学命題を証明します。AlphaGeometry 2 と共に、AlphaProof は国際数学オリンピック(IMO)で銀メダル相当の成績を収めました。その後、Gemini の高度な "Deep Think" モードの改良版が2025年IMOで金メダルレベルの性能を達成しました。
アルゴリズム発見と科学的協働
- AlphaEvolve: Gemini 搭載のコーディングエージェントで、コンピュータコードを探索し効率的なアルゴリズムを発見します。これにより、現代のニューラルネットワークの基盤となる行列乗算の新手法が見つかりました。
- AI Co-scientist: 探索と推論の原理を統合し、エージェントが科学的仮説を "議論" できるシステムです。ロンドン帝国大学での検証実験では、人間研究者が何年も要した抗菌薬耐性に関する仮説を独自に導き出しました。
DeepMindはまた、これらの技術をゲノム研究、核融合エネルギー、天気予報の分野でも活用しています。
汎用人工知能(AGI)への道筋
DeepMindは、AGIへの道は次の三つの核心要素の統合が必要だと考えています。
- World Models(世界モデル): 言語、音声、映像、画像、コードを理解するマルチモーダルシステム(例: Gemini)。
- Search and Planning(探索と計画): AlphaGo と AlphaZero が切り開いた推論・探索技術。
- Specialized Tool Use(専門ツールの利用): 汎用モデルが AlphaFold などの専門AIツールを呼び出す能力。
"Move 37" が示したように、AIが箱の外で考える能力は重要ですが、DeepMindは真のオリジナル発明とは、既存のゲームをマスターするだけでなく、囲碁と同等に深くエレガントな新しいゲームを創造できることだと定義しています。