Gemini 2.5 Deep Think 發布
Google DeepMind 已將 Deep Think 整合至 Gemini 應用程式,供 Google AI Ultra 訂閱者使用,提供先進的推理能力以解決複雜問題。本次發布引入了一個利用平行思考與延長推理時間的模型版本,以提升在數學、程式設計與科學研究等高度技術領域的表現。
平行思考與延伸推理
Deep Think 透過採用平行思考技術提升 Gemini 的推理能力,讓模型能同時產生、評估並結合多個想法,然後再給出最終答案。此過程由兩個主要技術驅動因素支援:
- 延伸「思考時間」:透過延長推理時間,模型能探索更多假設並精練對複雜問題的解決方案。
- 強化學習:Google DeepMind 開發了新穎的強化學習技術,鼓勵模型利用這些延伸的推理路徑,隨時間提升其直覺式問題解決能力。
效能與使用案例
Deep Think 針對需要迭代開發、策略規劃與逐步精練的任務而設計。其主要強項包括:
程式設計與演算法開發
Deep Think 在問題定義、時間複雜度與權衡考量至關重要的高難度程式設計問題上表現卓越。它在 LiveCodeBench V6(衡量競賽程式設計表現的基準)上達到最先進的表現。
科學與數學發現
該模型能夠推理複雜的科學文獻並提出數學猜想。雖然完整版本的 Gemini 2.5 Deep Think 在國際數學奧林匹克(IMO)中達到金牌水準,但 Gemini 應用程式中提供的版本已針對日常使用進行最佳化,根據內部評估在 2025 年 IMO 基準上達到銅牌等級的表現。
迭代設計
Deep Think 透過逐步構建複雜元件,提升網頁開發任務的美觀度與功能性。
除上述領域外,該模型亦在「Humanity’s Last Exam」這項衡量科學與數學專業知識的基準測試中達到最先進的表現。
安全性與責任
相較於 Gemini 2.5 Pro,Gemini 2.5 Deep Think 展示了更佳的內容安全性與語調客觀性。然而,內部測試顯示其對良性請求的拒絕傾向較高。Google DeepMind 正在進行前沿安全性評估,並針對關鍵能力層級實施緩解措施,以因應模型複雜度提升所帶來的風險。
可用性與實作
Deep Think 於 Gemini 應用程式內提供給 Google AI Ultra 訂閱者使用。使用者可在模型下拉選單中選擇「2.5 Pro」並在提示列中切換「Deep Think」選項以啟用。
主要運作細節包括:
- 工具整合:Deep Think 可自動與 Google Search 及程式碼執行協同運作。
- 回應長度:模型能產生遠超標準版本的較長回應。
- API 存取:將於未來幾週透過 Gemini API 向受信任的測試者釋出含工具與不含工具的 Deep Think 版本,以供開發者與企業評估。
Sources
- OriginalTry Deep Think in the Gemini app