Grok 4.6 發佈說明:代理式編碼與前沿智能
Grok 4.6 為代理式工作流提供前沿智能
Grok 4.6 專為長時程代理與雄心勃勃的互動式及視覺化工作設計,使模型能夠在多個步驟中維持複雜任務。它在研究主題、分析資訊、導航大型程式碼庫以及將產品構思轉化為精緻應用程式方面特別有效。
在 Artificial Analysis Intelligence Index(由九項基準測試組成的綜合評分)中,Grok 4.6 以 61 分的得分與 GPT-5.6 Sol 持平。它在代理式編碼與知識工作基準測試中也展現了強大的性能,特別是在以下領域相較於 Grok 4.5 有所提升:
- GDPVal-AA v2: 1753 (較 Grok 4.5 的 1526 有所提升)
- CursorBench v3.2: 69.9% (較 Grok 4.5 的 66.7% 有所提升)
- DeepSWE v1.1: 65.9% (較 Grok 4.5 的 54% 有所提升)
- FrontierCode v1.1 (Extended): 61.3% (較 Grok 4.5 的 56.6% 有所提升)
- APEX-Agents: 57.5% (較 Grok 4.5 的 47.1% 有所提升)
訓練與 RL 的技術改進
Grok 4.6 利用了更長的補充訓練時程與精煉的數據策劃來提升推理與技術能力。 訓練過程包含幾個關鍵階段:
- Foundation Training: xAI 使用了針對進階技術概念與推理的精選模型生成數據,並結合了高品質的工程數據與改進的優化器/訓練配方。
- SFT (Supervised Fine-Tuning): 使用 Grok 4.5 重新生成了涵蓋 STEM、軟體工程與知識工作的 SFT 軌跡。隨後使用基於模型的檢查來過濾掉有問題的軌跡。
- Agentic RL: 模型在廣泛的強化學習任務上進行了訓練,包括通用編碼與針對 Web 開發、內核優化及電腦輔助設計 (CAD) 的特定領域環境。
增強的專案開發能力
Grok 4.6 經過優化,能以極少的迭代將廣泛的產品構思轉化為可運行的初版。 與 Grok 4.5 相比,該模型在單次執行中建立應用程式結構與視覺語言的能力更強。
關鍵行為改進包括:
- Self-Verification: 在較長的軌跡中,模型在進行下一步之前,會更頻繁地對其工作進行自我測試與驗證。
- Visual/Interactive Strength: 模型在視覺化專案中能產出更高品質的初版,減少了對大量初始迭代的需求。
安全與部署
Grok 4.6 的安全堆疊已進行校準,以最大化合法工程與研究用例的效用。 這包括允許模型在漏洞修補等領域提供協助,並加速工程設計週期。xAI 報告稱,其使用了有史以來最廣泛的部署前測試套件與廣泛的第三方測試來校準這些防護措施。
可用性與定價
Grok 4.6 可透過 SpaceXAI API、Grok Build 與 Cursor 使用。 它也可以透過包括 OpenRouter、Vercel 與 Cloudflare 在內的合作夥伴取得。
- Standard Pricing: $2 per million input tokens; $6 per million output tokens.
- Fast Variant: 以兩倍於標準價格提供。
- Promotions: Grok Build 與 Cursor 的使用者在發佈首週將獲得 2 倍的包含使用量。
社群洞察與反對意見
雖然官方基準測試顯示其與其他前沿模型持平,但來自 Hacker News 的社群回饋呈現了混合的觀點:
性能與效率
某些使用者報告 Grok 4.6 比競爭對手更簡潔,「直擊重點」,而其他人則認為它在 Token 使用效率上不如 GPT-5.6 Sol。
"[Grok 4.5] just gets to the point, and is super fast and concise, no yapping... None of the 'Claude ipsum' jargon... or GPT 5.6-isms."
相反,一些早期採用者發現該模型比其前身更慢,且遵循複雜指令的能力較弱:
"I've had a few interactions with it through cursor and first impression is: I'm underwhelmed. The plans it produces are all over the place and hard to follow... Grok 4.5 produced better plans."
信任與治理
關於 xAI 領導層的信任度存在顯著討論。部分使用者因擔心數據隱私與 Elon Musk 在公司營運中的個人參與,而表達了對其他實驗室的偏好。
API 實作
技術使用者指出,SpaceXAI API 似乎會注入一個預設的系統提示詞 (system prompt),該提示詞優先考慮特定的安全指南(例如拒絕編寫 Exploit 或 Malware),其優先級高於使用者提供的系統指令,有時會導致模型拒絕討論系統提示詞本身。
Sources
- HNGrok 4.6
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch