Grok 4.5 發行說明

xAI 已推出 Grok 4.5,這是一款專為高效率程式設計、代理任務與知識工作所設計的模型。該模型被定位為 xAI 至今最強大的模型,由 xAI 與 Cursor 共同開發。

工程與程式設計效能

Grok 4.5 在真實世界工程任務中展現出強大的能力,特別是在軟體工程基準測試中表現出色。它在特定解決率上超越多款領先模型,但其表現在不同評估框架中有所差異。

基準測試結果

  • SWE Marathon (pass@1): Grok 4.5 取得 29.0% 的解決率,超過 Opus 4.8 (max) 的 26.0% 與 Fable (max) 的 24.0%。
  • Terminal Bench 2.1: Grok 4.5 獲得 83.3%,緊追 Fable (max) 的 84.3% 與 GPT 5.5 (xhigh) 的 83.4%。
  • SWE Bench Pro: Grok 4.5 取得 64.7% 的解決率,超越 Opus 4.7 (max) 的 64.3%、GLM 5.2 的 62.1%,以及 GPT 5.5 (xhigh) 的 58.6%。
  • DeepSWE 1.0: Grok 4.5 獲得 62.0%,落後於 Fable (max) 的 66.1% 與 GPT 5.5 (xhigh) 的 64.31%。
  • DeepSWE 1.1: Grok 4.5 獲得 53%,落後於 Fable (max) 的 70%、GPT 5.5 (xhigh) 的 67%,以及 Opus 4.8 (max) 的 59%。

技術訓練與基礎設施

Grok 4.5 使用數萬張 NVIDIA GB300 GPU 進行訓練。訓練過程透過去重、品質評分與領域導向的資料選擇,強調資料品質而非純量,以維持高訊號資料混合。

強化學習與代理能力

為提升每 token 的智慧,xAI 將強化學習(RL)擴展至數十萬項任務。此 RL 訓練專注於多步驟軟體工程與技術工作,採用自動化與模型導向的評分方式。訓練架構支援高度非同步運作,使代理執行可持續數小時,同時 GPU 集群中的學習持續進行。

效率與服務速度

Grok 4.5 的服務速度為每秒 80 個 token(TPS)。其具有高 token 效率,解決任務所需的 token 數量顯著少於競爭對手。

在 SWE Bench Pro 任務中,Grok 4.5 平均使用 15,954 個輸出 token 解決任務,約為 Opus 4.8 (max) 所需的 67,020 個 token 的 4.2 倍少。

辦公室生產力與整合

Grok 4.5 是 Grok Build 的預設模型,並已整合至 Cursor。它將其技術能力延伸至辦公室軟體,包括:

  • Excel: 建立複雜模型,結合網路研究、跨工作表公式與內部註解。
  • PowerPoint: 使用原生圖形建立複雜圖表,並設計簡報內容。
  • Word: 撰寫清晰的敘述,並規劃業務評估大綱。

價格與可用性

  • 價格: 輸入 token 價格為每百萬個 2 美元,輸出 token 價格為每百萬個 6 美元。
  • 可用性: 模型可透過 Grok Build、Cursor(所有方案)以及 SpaceXAI 控制台 API 取得。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch