xAI Grok 4 發布說明
xAI 已宣布推出 Grok 4,這款模型透過擴展的強化學習與原生工具使用,旨在突破前沿智慧的界限。該模型已對 SuperGrok 和 Premium+ 用戶開放,同時也可透過 xAI API 取得。
擴展的強化學習與基礎設施
Grok 4 的推理能力是透過將強化學習(RL)訓練擴展至預訓練規模而開發的。此進展由 Colossus 200,000 GPU 集群及基礎設施,以及算法創新所支援,使運算效率提升了 6 倍。
為提升模型的多功能性,xAI 將可驗證的訓練資料範圍從數學與程式設計擴展至多個額外領域。此方法在使用比以往訓練運行多出一個數量級以上的運算資源的情況下,實現了平滑的性能提升。
原生工具使用與 X 平台整合
Grok 4 經由強化學習訓練,可原生使用工具,使其推理能力得以結合程式碼解譯器與網路瀏覽功能。模型能自主決定自身的搜尋查詢,從網路各處整合資訊以產生高品質回應。
與 X 平台的整合是核心功能之一,使 Grok 4 能使用先進的關鍵字與語意搜尋工具,以及媒體分析功能,從 X 平台內即時取得資訊。
Grok 4 Heavy 與平行測試時運算
Grok 4 Heavy 是一款專用版本的模型,利用平行測試時運算,使其能同時考慮多個假設。此變體在可靠性與複雜推理方面設定了新的性能標準:
- 人類最後一場考試: Grok 4 Heavy 是首款在這項專家級基準測試中得分達 50%(文本僅子集為 50.7%)的模型。
- 學術基準: 該模型在大多數學術基準上已達到飽和表現。
前沿智慧基準測試
Grok 4 在多項高難度封閉模型基準測試中展現了領先業界的表現:
- ARC-AGI V2: 成績達 15.9%,幾乎是 Claude Opus 的 ~8.6% 的兩倍。
- Vending-Bench(代理型): 獲得淨資產 4,694.15 美元,售出 4,569 單位,顯著超越 Claude Opus 4(2,077.41 美元)與人類(844.05 美元)。
- USAMO'25: Grok 4 Heavy 以 61.9 分領先。
API 功能與企業級安全性
Grok 4 API 為開發者提供多模態理解能力與 256,000 token 的上下文視窗。主要功能包括:
- 即時搜尋 API: 整合跨 X、網路與新聞來源的即時資料搜尋。
- 合規性: API 已通過 SOC 2 Type 2、GDPR 與 CCPA 認證。
- 可用性: 該模型即將推出至超級雲端合作夥伴,以支援企業部署。
多模態語音與視覺模式
xAI 推出升級版語音模式,具備更真實與即時的回應能力。此模式包含新語音與重新設計的對話介面。
此外,Grok 4 現在可處理即時視覺輸入。透過在語音聊天中啟用影片,模型能即時分析使用者的相機畫面,並根據所見提供洞察。此功能是利用內部開發的強化學習框架與語音壓縮技術所實現。
未來發展路線圖
xAI 計畫持續擴展強化學習,從受控領域中的可驗證獎勵,進一步拓展至解決動態環境中的複雜現實問題。未來發展將聚焦於提升視覺與音訊的多模態整合,以打造更直覺且高效的 AI 系統。
Sources
- OriginalGrok 4
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch