Grok 4.5 發行說明
xAI 已推出 Grok 4.5,這是一款專為高效率程式設計、代理任務與知識工作所設計的模型。該模型被定位為 xAI 至今最強大的模型,由 xAI 與 Cursor 共同開發。
工程與程式設計效能
Grok 4.5 在真實世界工程任務中展現出強大的能力,特別是在軟體工程基準測試中表現出色。它在特定解決率上超越多款領先模型,但其表現在不同評估框架中有所差異。
基準測試結果
- SWE Marathon (pass@1): Grok 4.5 取得 29.0% 的解決率,超過 Opus 4.8 (max) 的 26.0% 與 Fable (max) 的 24.0%。
- Terminal Bench 2.1: Grok 4.5 獲得 83.3%,緊追 Fable (max) 的 84.3% 與 GPT 5.5 (xhigh) 的 83.4%。
- SWE Bench Pro: Grok 4.5 取得 64.7% 的解決率,超越 Opus 4.7 (max) 的 64.3%、GLM 5.2 的 62.1%,以及 GPT 5.5 (xhigh) 的 58.6%。
- DeepSWE 1.0: Grok 4.5 獲得 62.0%,落後於 Fable (max) 的 66.1% 與 GPT 5.5 (xhigh) 的 64.31%。
- DeepSWE 1.1: Grok 4.5 獲得 53%,落後於 Fable (max) 的 70%、GPT 5.5 (xhigh) 的 67%,以及 Opus 4.8 (max) 的 59%。
技術訓練與基礎設施
Grok 4.5 使用數萬張 NVIDIA GB300 GPU 進行訓練。訓練過程透過去重、品質評分與領域導向的資料選擇,強調資料品質而非純量,以維持高訊號資料混合。
強化學習與代理能力
為提升每 token 的智慧,xAI 將強化學習(RL)擴展至數十萬項任務。此 RL 訓練專注於多步驟軟體工程與技術工作,採用自動化與模型導向的評分方式。訓練架構支援高度非同步運作,使代理執行可持續數小時,同時 GPU 集群中的學習持續進行。
效率與服務速度
Grok 4.5 的服務速度為每秒 80 個 token(TPS)。其具有高 token 效率,解決任務所需的 token 數量顯著少於競爭對手。
在 SWE Bench Pro 任務中,Grok 4.5 平均使用 15,954 個輸出 token 解決任務,約為 Opus 4.8 (max) 所需的 67,020 個 token 的 4.2 倍少。
辦公室生產力與整合
Grok 4.5 是 Grok Build 的預設模型,並已整合至 Cursor。它將其技術能力延伸至辦公室軟體,包括:
- Excel: 建立複雜模型,結合網路研究、跨工作表公式與內部註解。
- PowerPoint: 使用原生圖形建立複雜圖表,並設計簡報內容。
- Word: 撰寫清晰的敘述,並規劃業務評估大綱。
價格與可用性
- 價格: 輸入 token 價格為每百萬個 2 美元,輸出 token 價格為每百萬個 6 美元。
- 可用性: 模型可透過 Grok Build、Cursor(所有方案)以及 SpaceXAI 控制台 API 取得。
Sources
- OriginalIntroducing Grok 4.5
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch