Grok 3 Beta 發佈說明 / 有什麼新功能

xAI 推出了 Grok 3 Beta,這是一個將廣泛的預訓練知識與先進推理能力相結合的模型系列。Grok 3 是在 Colossus 超級集群上訓練的,其運算量是先前最先進模型的 10 倍,在數學、程式碼、世界知識和指令遵循任務中展現出顯著的改進。

透過測試時運算實現先進推理

Grok 3 引入了專門的推理模型,Grok 3 (Think) 和 Grok 3 mini (Think),它們利用大規模強化學習 (RL) 來精煉其思維鏈 (chain-of-thought) 過程。這些模型可以採用測試時運算 (test-time compute),在提供最終答案之前,花費從幾秒鐘到幾分鐘的時間進行回溯、糾正錯誤並探索多種問題解決策略。

推理模型的性能基準測試包括:

  • AIME 2025: Grok 3 (Think) 在使用最高等級的測試時運算 (cons@64) 時達到了 93.3%。
  • GPQA (研究生級別專家推理): Grok 3 (Think) 達到了 84.6%。
  • LiveCodeBench: Grok 3 (Think) 在程式碼生成和問題解決方面達到了 79.4%。
  • AIME 2024: Grok 3 mini 達到了 95.8%。
  • LiveCodeBench: Grok 3 mini 在 STEM 任務中達到了 80.4%。

使用者可以透過「Think」按鈕存取這些功能,該按鈕提供完全的透明度,允許使用者檢查模型的內部推理過程。

預訓練與通用性能

當推理功能被禁用時,Grok 3 提供高品質、即時的回答,並在非推理模型中取得了最先進的結果。它具有 100 萬個 token 的上下文窗口,這比先前的 xAI 模型大八倍,增強了其處理廣泛文件並保持指令遵循準確性的能力。

關鍵基準測試的比較性能(Grok 3 Beta 對比競爭對手):

| Benchmark | Grok 3 Beta | Gemini 2.0 | DeepSeek-V3 | GPT 4o | Claude 3.5 Sonnet | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | AIME’24 | 52.2% | — | 39.2% | 9.3% | 16.0% | | GPQA | 75.4% | 64.7% | 59.1% | 53.6% | 65.0% | | LCB | 57.0% | 36.0% | 33.1% | 32.3% | 40.2% | | MMLU-pro | 79.9% | 79.1% | 75.9% | 72.6% | 78.0% | | LOFT (128k) | 83.3% | 75.6% | — | 78.0% | 69.9% | | MMMU | 73.2% | 72.7% | — | 69.1% | 70.4% | | EgoSchema | 74.5% | 71.9% | — | 72.2% | — |

該模型的早期版本,代號為 chocolate, 之前在 LMArena Chatbot Arena 排行榜上以 1402 的 Elo 分數位居榜首。

Grok Agents 與 DeepSearch

為了將模型的能力擴展到現實世界的互動中,xAI 正在推出 Grok Agents,它們將推理與工具使用結合起來,包括網路存取和程式碼解釋器。

第一個代理程式 DeepSearch 旨在從整個人類知識庫中綜合資訊,透過衝突的事實進行推理,並生成全面的報告。它適用於從即時新聞綜合到深入的科學研究等各種使用場景。

提供方式與路線圖

  • 使用者存取: Grok 3 可供 X 和 Grok.com 上的 Premium 與 Premium+ 使用者使用。Premium+ 使用者可以立即存取 ThinkDeepSearch 功能,並擁有更高的使用限制。
  • API 存取: Grok 3 與 Grok 3 mini,包括標準版與推理版,將在未來幾週內透過 API 平台發佈。DeepSearch 將透過 API 提供給企業合作夥伴。
  • 未來發展: 訓練工作正在進行中。未來對企業級 API 的更新將包括工具使用、程式碼執行以及先進的代理程式能力,重點在於可擴展的監督與對抗性魯棒性。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch