Gemini Deep Think 在 IMO 2025 獲得金牌標準
Gemini Deep Think 在 IMO 2025 獲得金牌表現
Gemini 搭配 Deep Think 的進階版本已正式在 2025 年國際數學奧林匹克(IMO)達到金牌標準,完美解答了六題中的五題,總分 35 分。此結果由 IMO 協調員依照與學生解答相同的評分標準進行官方評分與認證。
從 AlphaProof 與 AlphaGeometry 的技術演進
此成就相較於 2024 年的成果,代表了 AI 數學推理的顯著飛躍。2024 年,Google DeepMind 的 AlphaProof 與 AlphaGeometry 2 系統透過解答四題、取得 28 分,達到銀牌標準,但需要專家將題目翻譯成如 Lean 等領域特定語言,且計算時間需兩至三天。
相較之下,2025 年的 Gemini Deep Think 模型以自然語言端到端運作,直接從官方題目描述產出嚴謹的數學證明,且在 4.5 小時的比賽時間限制內完成。
Deep Think 推理架構
Gemini Deep Think 是為複雜問題設計的增強推理模式。它運用了多項關鍵研究技術,以提升解題能力:
- Parallel Thinking(平行思考): 不再僅遵循單一線性思考鏈,模型能同時探索並結合多條可能的解題路徑,最後得出答案。
- Reinforcement Learning(強化學習): 模型使用專為多步推理、定理證明與解題資料設計的新型強化學習技術進行訓練。
- Curated Knowledge(精選知識): 系統提供了一套精選的高品質數學解答語料庫,以及包含一般提示與技巧的特定說明,協助處理 IMO 級別的問題。
對數學與 AGI 未來的影響
Google DeepMind 認為此結果是朝建構能解決更複雜與高階數學的 AI 前進的早期步驟。儘管 2025 年的成功依賴自然語言流暢度,該實驗室仍持續開發如 AlphaGeometry 與 AlphaProof 等形式系統。
DeepMind 主張,數學發現的未來在於結合自然語言流暢度與形式語言中驗證推理的代理人。此類工具旨在協助數學家、科學家與工程師推進人類知識,邁向通用人工智慧(AGI)的道路。
可用性
Deep Think 模型的版本將先釋出給包括數學家在內的一批可信測試者,之後再向 Google AI Ultra 訂閱者推出。