Grok 4.6 發佈說明 / 有什麼新功能

xAI 已發佈 Grok 4.6,這是一款專為長時間運行的代理(agents)以及複雜的互動與視覺化工作而優化的模型。該模型旨在於程式碼庫分析、深度研究和精緻應用程式開發等多步驟任務中保持進展。

在代理編碼與知識工作方面的尖端性能

Grok 4.6 在多項代理基準測試中達到了尖端水平的智能,在整合了九種不同基準測試的 Artificial Analysis (AA) Intelligence Index 上,表現與 GPT-5.6 Sol 持平。

根據提供的評估數據,Grok 4.6 在多項指標上較 Grok 4.5 有顯著提升:

Benchmark Grok 4.6 High Grok 4.5 High GPT-5.6 Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 (Ext) 61.3% 56.6% 60.6% 63.6%
APEX-Agents 57.5% 47.1% 56.7% 59.2%
Terminal-Bench v3.0 26% 15.7% 34.6% 34.1%
APEX-SWE 56.4% 53.6% 58.8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%

技術訓練方法論

Grok 4.6 是透過多階段訓練流程開發的,旨在強化其推理與技術執行能力。

補充訓練與優化

該模型經歷了比其前身 Grok 4.5 更長的補充訓練階段。此階段使用了改進的優化器(optimizer)與訓練配方,並納入了高品質的工程數據以及針對進階技術概念與推理而精心挑選的模型生成數據。

SFT 與 RL 精煉

xAI 使用 Grok 4.5 來重新生成涵蓋軟體工程、STEM、知識工作與代理框架(agent harnesses)的監督式微調(SFT)軌跡。這些軌跡透過基於模型的檢查來過濾掉有問題的紀錄。在 SFT 之後,該模型在廣泛的代理強化學習(RL)任務上進行了訓練,包括:

  • 一般編碼與知識工作。
  • 網頁開發與電腦輔助設計(CAD)的特定領域環境。
  • 核心(Kernel)優化。

增強的代理能力與視覺化工作

Grok 4.6 展示了處理長路徑專案的能力提升,特別是在將廣泛的產品構想轉化為功能性的初步版本方面。

迭代開發與自我驗證

該模型可以研究陌生領域、建構應用程式架構,並實作核心互動功能。在處理較長任務時,Grok 4.6 展現出湧現行為(emergent behaviors),例如自我測試與驗證,即模型會在繼續下一步之前先檢查自己的工作成果。

視覺與互動式專案

Grok 4.6 與 Grok 4.5 相比,在視覺化專案中提供了更強的初步嘗試能力,能夠在單次嘗試中建立應用程式的結構與視覺語言。這讓使用者可以從一個紮實的基礎開始並進行快速迭代。

安全性與部署

Grok 4.6 的安全防護機制已根據模型擴展的能力進行了校準,以匹配其增強的性能。安全技術棧(safety stack)旨在維持安全性的同時,最大化對於合法的高技術使用案例(如 AI 研究、工程設計週期與漏洞修補)的實用性。部署前的測試包括 xAI 史上規模最大的能力與防護校準套件,並輔以部署後的測試與第三方測試。

可用性與定價

Grok 4.6 可透過以下平台使用:

  • Integrations: Cursor 和 Grok Build(首週包含 2 倍使用量)。
  • API: 可透過 SpaceXAI API、OpenRouter、Vercel 和 Cloudflare 使用。

定價結構:

  • Standard: 每百萬 input tokens 為 $2 / 每百萬 output tokens 為 $6。
  • Fast Variant: 價格為標準版的兩倍。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch