Gemini 2.5 Deep Think ICPC 世界總決賽表現

Gemini 2.5 Deep Think 在 ICPC 世界總決賽達到金牌等級

Gemini 2.5 Deep Think 的進階版本在 2025 年國際大學生程式設計競賽(ICPC)世界總決賽中達到金牌等級的表現。此里程碑顯示了在抽象問題解決方面的顯著飛躍,且緊接著兩個月前在國際數學奧林匹克(IMO)取得金牌標準的成就。

表現指標與排名

Gemini 2.5 Deep Think 在比賽期間解決了 12 題中的 10 題,遵循與人類參賽者相同的五小時時間限制(於開始後 10 分鐘啟動)。

主要表現統計包括:

  • Problem Solving Rate:10/12 題正確解決。
  • Speed:八題在前 45 分鐘內解決,另外兩題在三小時內完成。
  • Total Time:模型總共使用 677 分鐘解決這 10 題。
  • Comparative Rank:根據這些結果,Gemini 2.5 Deep Think 在比賽的所有大學隊伍中將排名第 2 名。

解決未解決的題目:問題 C 案例

Gemini 2.5 Deep Think 成功解決了問題 C,這是比賽中沒有任何大學隊伍能解出的題目。問題 C 涉及在互相連接的管道網路中優化液體分配至水庫,以找出最快的填充配置。

為了解決此問題,模型採用了以下精密推理鏈:

  1. Priority Value Assumption:假設每個水庫都有一個「優先值」以表示其相對的偏好程度。
  2. Dynamic Programming:使用動態規劃演算法在給定的優先值集合下找出最佳管道配置。
  3. Minimax Theorem:套用極小極大定理以找出使得最終流量最受限制的優先值。
  4. Nested Ternary Searches:利用巢狀三分搜尋在類碗形的凸解空間中導航,確定最佳的優先值。

突破的技術基礎

模型的卓越表現源於預訓練、後訓練、創新強化學習(RL)技術、多步推理與平行思考的整合進步。

為了提升其能力,Google DeepMind 訓練 Gemini 進行最困難程式問題的推理與程式碼生成,使模型能從結果回饋中學習並演化其方法。系統利用多個 Gemini 代理人提出解決方案、透過終端執行程式碼與測試,並根據所有嘗試的結果迭代這些解決方案。

內部研究顯示,此版本的 Gemini 2.5 Deep Think 亦能在 2023 年與 2024 年的 ICPC 世界總決賽中達到金牌等級的表現,與全球前 20 名的競賽程式設計師相當。

對軟體工程與 AGI 的影響

此成就表明 AI 能成為程式設計師的高階問題解決夥伴。Google DeepMind 指出,若將比賽中最佳的 AI 與人類解決方案結合,所有 12 題皆可正確解決,顯示 AI 與人類專業之間的互補關係。

除了程式編寫外,理解複雜問題、制定多步邏輯計畫並完美執行的能力亦可應用於其他科學與工程領域,如微晶片設計與藥物發現。此進展標誌著人工通用智慧(AGI)的一步,將 AI 從資訊處理推向解決複雜推理問題的階段。

Gemini 成功加入此領域,並取得金牌級成果,標誌著定義下一代 AI 工具與學術標準的關鍵時刻。

— Dr. Bill Poucher, ICPC Global Executive Director

SUMMARY: Gemini 2.5 Deep Think 的進階版本在 2025 年國際大學生程式設計競賽(ICPC)世界總決賽中達到金牌等級的表現,解決了 12 題中 10 題複雜的演算法問題。

TITLE: Gemini 2.5 Deep Think ICPC 世界總決賽表現

Sources