xAI Grok 4.7 發布:功能、基準測試與社群反應
Grok 4.7 在與 4.6 相同的價格下,提供更強的長上下文程式碼與安全性
xAI 於 2026‑09‑21 宣布推出 Grok 4.7,定位為 Grok 系列中最具能力的程式碼與知識工作模型。該模型的輸入與輸出代幣定價與 Grok 4.6 相同,均為每百萬輸入代幣 2 美元、每百萬輸出代幣 6 美元,但聲稱具備更長的推理視窗、更佳的自我驗證能力,以及公司迄今發布最強大的安全防護系統。
核心技術改進
- 更大的基礎模型:根據社群猜測,Grok 4.7 的架構比 4.6 更大,參數量約多出 40 %。
- 延長的強化學習訓練:強化學習階段被延長,並更傾向於多小時的任務,提升了在長時間程式碼生成基準測試(例如 CursorBench 4.0)上的表現。
- 原生 Grok Bot 整合:模型現在能直接理解 Grok Bot 的框架,提升了對話與一般知識任務的表現。
- 增強的自我檢查:新增的驗證迴圈讓模型能更可靠地發現自身錯誤,這是在報告中安全提升的關鍵因素。
基準測試表現概覽
| 基準測試 | Grok 4.7 | Grok 4.6 | GPT‑5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0(軟體工程) | 46.3 % | 40.4 % | 41.7 % | 51.8 % |
| DeepSWE v1.1(軟體工程,高耗時) | 71.0 %* | 65.2 % | 72.7 % | 70.0 % |
| EEBench(電氣工程) | 64.0 % | 53.0 % | 39.4 % | 56.4 % |
| AA Briefcase v1.1(多小時辦公工作) | 1,657 分 | 1,546 分 | 1,487 分 | 1,678 分 |
| Terminal‑Bench 4.0(多小時終端工作) | 38.0 % | 20.3 % | 37.3 % | 57.9 % |
| Harvey Legal Agent | 19.6 % | 15.8 % | 2.5 % | 6.7 % |
| HealthBench Professional | 56.7 % | 48.5 % | 60.5 % | 62.1 % |
*高耗時得分。
重點:Grok 4.7 在多數工程與專業工作基準測試中領先其自身系列,特別是在長上下文任務方面,同時仍保持與前代產品相同的價格競爭力。
安全性與雙用途控制
- 新的安全防護系統:發布說明聲稱這是迄今為止最強的拒絕與越獄抵抗能力。
- HackerBench v0.3:Grok 4.7 僅允許 3.3 % 的高風險雙用途提示通過,同時仍允許合法的安全研究。
- LatchBio 生物安全基準測試:模型得分 62.4 %,為評估的前沿模型中最高。
- 紅隊存取:部分資安合作夥伴可獲得邀請制的 Grok 4.7 防禦能力存取權。
定價與可用性
- 代幣定價:每百萬輸入代幣 2 美元、每百萬輸出代幣 6 美元(與 Grok 4.6 相同)。「快速」版本價格翻倍,輸出速度提升一倍。
- 存取管道:透過 Cursor、Grok Build、Grok API、第三方程式碼框架以及雲端模型路由器提供。
- 免費試用:使用者可透過 x.ai/build 嘗試 Grok Build。
社群在 Hacker News 上的反應
正面評價
- 長時間程式碼執行:使用者報告 Grok 4.6 已能處理複雜的建置根設定;許多使用者預期 4.7 將在此方面進一步提升。
- 前端開發:多位評論者讚揚 Grok 生成 HTML/CSS/JS 片段的快速能力。
- 安全性感知:新的安全防護系統被視為雙用途領域的重要進步。
批評與擔憂
代幣效率退步:多位評論者指出輸出代幣消耗大幅上升(例如,CursorBench 得分 46 % 消耗 240 M 代幣,而 4.6 僅需 97 M),顯示模型在定價不變的情況下更不經濟。
"與 Grok 4.6 相比,代幣效率顯著退步,此說法來自 artificialanalysis.ai 智能指數比較。" – @notduckrabbit
基準測試相關性質疑:部分使用者質疑比較對象的選擇(例如 GPT‑5.6 Sol、Fable 5.1),並忽略中國模型如 Kimi 或 DeepSeek。
"為什麼比較基準中沒有加入 Kimi、Deepseek 等中國模型?" – @shdtabasum
快取定價不透明:公開定價表僅列出輸入/輸出定價,快取讀取成本則隱藏,引發誘導性定價的指控。
"每次 Grok 發布都隱藏其快取定價,同時強調輸入/輸出定價……長時間的代理工作流程主要由快取讀取主導。" – @GodelNumbering
效能與成本的權衡:使用者報告快速版本價格翻倍,但速度提升不顯著,且快取罰款使 Grok 比 DeepSeek 4.1 Flash 等替代方案更昂貴。
"Grok 真的很貴。我用 DeepSeek 4.1 Flash 只花一小部分價格就獲得極佳結果。" – @meerita
基準測試結果參差不齊:雖然 Grok 4.7 在許多任務上超越 4.6,但在某些專門基準測試(如圖像轉 HTML 生成、全知測試)上仍落後於 Astra 和 Gemini 3.8 Flash 等競爭對手。
"Astra 真是不一樣。雖然貴,但我的任務用的代幣少很多。" – @saejox "Grok 4.7 在 Redactle LLM 排行榜上接近頂端,但仍不如 Gemini 3.8 Flash。" – @pampas
使用者體驗退步:部分早期使用者觀察到回應速度變慢、代幣消耗增加,導致訂閱方案的配額更快耗盡。
"4.7 肯定更慢也更貴……我今天測試時進展很慢。" – @mchusma
混合反饋對前沿發展的意義
- 基準提升有限:Grok 4.7 的主要改進(例如 CursorBench 上 +6 %)雖真實存在,但並非革命性;該模型在多項任務上仍落後於頂尖前沿模型。
- 定價策略至關重要:在輸入/輸出定價不變的情況下增加代幣消耗,可能削弱成本效益,特別是對重度使用者與代理程式而言。
- 安全性進步是差異化因素:迄今最強的越獄抵抗能力,可能使 Grok 4.7 對受監管產業更具吸引力,儘管其代幣消耗較高。
- 社群監督日益嚴格:使用者要求提高快取定價、基準測試方法與實際代幣效率的透明度,顯示未來發布需提供更清晰的成本揭露。
總結
Grok 4.7 透過更長的上下文視窗、更好的自我驗證與公司迄今最強的安全防護系統,推動 xAI 的程式碼導向模型向前發展。然而,基準測試提升有限、代幣消耗增加以及快取定價不透明,導致開發者社群反應兩極。該模型的價值主張如今取決於其安全性保證與長時間任務表現,是否能抵消實際工作負載中增加的運營成本。
Sources
- HNGrok 4.7
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch