Gemini 2.5 Deep Think ICPC 世界大会 パフォーマンス
Gemini 2.5 Deep Think が ICPC 世界大会で金メダルレベルを達成
高度なバージョンの Gemini 2.5 Deep Think が、2025 年国際大学プログラミングコンテスト(ICPC)世界大会で金メダルレベルのパフォーマンスを達成しました。このマイルストーンは、抽象的な問題解決における大きな飛躍を示すものであり、2 ヶ月前に国際数学オリンピック(IMO)で金メダル基準の成果を達成したことに続きます。
パフォーマンス指標と順位
Gemini 2.5 Deep Think は、コンテスト中に 12 問中 10 問を解き、人間の参加者と同じ 5 時間の制限時間(開始から 10 分後に開始)で動作しました。
主なパフォーマンス統計は以下の通りです:
- 問題解決率: 10/12 問正解。
- 速度: 8 問は最初の 45 分以内に解かれ、残りの 2 問は 3 時間以内に解かれました。
- 総時間: モデルは 10 問を解くのに合計 677 分を使用しました。
- 比較順位: これらの結果に基づくと、Gemini 2.5 Deep Think は大会の大学チーム全体で総合 2 位になるでしょう。
未解決問題の解決:問題 C のケース
Gemini 2.5 Deep Think は、コンテストの大学チームが解くことができなかった問題 C を成功裏に解決しました。問題 C は、相互接続されたダクトのネットワークを通じて液体をリザーバーに分配し、最速の充填構成を見つける最適化タスクでした。
これを解くために、モデルは高度な推論チェーンを使用しました:
- 優先度値の仮定: 各リザーバーが相対的な好ましさを表す「優先度値」を持つと仮定しました。
- 動的計画法: 与えられた優先度値のセットに対して最適なダクト構成を見つけるために動的計画法アルゴリズムを使用しました。
- ミニマックス定理: 結果として得られる流れが最も制約されるような優先度値を見つけるためにミニマックス定理を適用しました。
- 入れ子状三分探索: ボウル状の凸解空間を探索し、最適な優先度値を特定するために入れ子状の三分探索を利用しました。
ブレークスルーの技術的基盤
モデルのパフォーマンスは、事前学習、事後学習、革新的な強化学習(RL)手法、マルチステップ推論、並列思考の統合的な進歩の結果です。
能力を強化するために、Google DeepMind は Gemini に最も難しいプログラミング問題に対して推論しコードを生成させ、結果に対するフィードバックから学習しアプローチを進化させました。システムは複数の Gemini エージェントを利用し、解決策を提案し、ターミナル経由でコードとテストを実行し、すべての試行結果に基づいてその解決策を反復します。
内部調査によると、このバージョンの Gemini 2.5 Deep Think は 2023 年および 2024 年の ICPC 世界大会でも金メダルレベルのパフォーマンスを達成し、世界トップ 20 の競技プログラマーと同等に競うことができると示唆されています。
ソフトウェア工学とAGIへの影響
この成果は、AI がプログラマーにとって高度な問題解決パートナーとなり得ることを示しています。Google DeepMind は、コンテストのベスト AI ソリューションと人間のソリューションを組み合わせれば、12 問すべてが正しく解かれたと指摘しており、AI と人間の専門知識が相補的な関係にあることを示唆しています。
コーディングを超えて、複雑な問題を理解し、マルチステップの論理計画を策定し、完璧に実装する能力は、マイクロチップ設計や薬剤発見などの他の科学・工学分野にも応用可能です。この進展は、情報処理から複雑な推論問題の解決へと AI を移行させることで、汎用人工知能(AGI)への一歩を示しています。
Gemini がこの分野に成功裏に参入し、金レベルの成果を達成したことは、次世代に必要な AI ツールと学術基準を定義する上で重要な瞬間です。
— Dr. Bill Poucher, ICPC グローバル エグゼクティブディレクター