Gemini 3 Deep Think 更新
Google DeepMind 已發布對 Gemini 3 Deep Think 的重大升級,這是一種專門的推理模式,旨在解決科學、研究與工程中的複雜挑戰。此更新著重於提供數學與演算法的嚴謹性,以應對缺乏明確指引或唯一正確解答的問題,這類問題常涉及雜亂或不完整的資料。
最先進的推理與演算法效能
Gemini 3 Deep Think 在多項嚴謹的學術與競賽基準上達到全新效能高峰。更新後的模型取得以下成果:
- Humanity’s Last Exam:48.4% 正確率(不使用工具),為測試前沿模型極限的基準樹立新標準。
- ARC-AGI-2:84.6% 正確率,經 ARC Prize Foundation 驗證。
- Codeforces:在競程挑戰中取得 3455 的 Elo 分數。
- International Math Olympiad (IMO) 2025:金牌等級表現。
科學領域的熟練度
除了數學與程式設計外,更新後的 Deep Think 模式在廣泛的科學領域亦表現卓越,特別是化學與物理。它在 2025 年國際物理奧林匹克與 2025 年化學奧林匹克的筆試部分展現金牌等級的成果。此外,模型在 CMT-Benchmark 上取得 50.5% 的分數,顯示其在高階理論物理方面的熟練度。
實務工程應用
Gemini 3 Deep Think 的設計旨在超越抽象理論,提供實務效用。該模型讓研究人員能夠解讀複雜資料,並使工程師能透過程式碼對物理系統進行建模。此能力的一項具體應用是,透過分析圖稿、建模複雜形狀,將草圖轉換為可 3D 列印的檔案,並產生所需的 3D 列印檔案。
可用性與存取
更新後的 Deep Think 模式已立即在 Google AI Ultra 訂閱者的 Gemini 應用中提供。首次,Deep Think 亦透過 Gemini API 向特定研究人員、工程師與企業提供早期存取計畫。