xAI Grok 4.7 發布:功能、基準測試與社群反應

Grok 4.7 在與 4.6 相同的價格下,提供更強的長上下文程式碼與安全性

xAI 於 2026‑09‑21 宣布推出 Grok 4.7,定位為 Grok 系列中最具能力的程式碼與知識工作模型。該模型的輸入與輸出代幣定價與 Grok 4.6 相同,均為每百萬輸入代幣 2 美元、每百萬輸出代幣 6 美元,但聲稱具備更長的推理視窗、更佳的自我驗證能力,以及公司迄今發布最強大的安全防護系統。


核心技術改進

  • 更大的基礎模型:根據社群猜測,Grok 4.7 的架構比 4.6 更大,參數量約多出 40 %。
  • 延長的強化學習訓練:強化學習階段被延長,並更傾向於多小時的任務,提升了在長時間程式碼生成基準測試(例如 CursorBench 4.0)上的表現。
  • 原生 Grok Bot 整合:模型現在能直接理解 Grok Bot 的框架,提升了對話與一般知識任務的表現。
  • 增強的自我檢查:新增的驗證迴圈讓模型能更可靠地發現自身錯誤,這是在報告中安全提升的關鍵因素。

基準測試表現概覽

基準測試 Grok 4.7 Grok 4.6 GPT‑5.6 Sol Fable 5.1
CursorBench 4.0(軟體工程) 46.3 % 40.4 % 41.7 % 51.8 %
DeepSWE v1.1(軟體工程,高耗時) 71.0 %* 65.2 % 72.7 % 70.0 %
EEBench(電氣工程) 64.0 % 53.0 % 39.4 % 56.4 %
AA Briefcase v1.1(多小時辦公工作) 1,657 分 1,546 分 1,487 分 1,678 分
Terminal‑Bench 4.0(多小時終端工作) 38.0 % 20.3 % 37.3 % 57.9 %
Harvey Legal Agent 19.6 % 15.8 % 2.5 % 6.7 %
HealthBench Professional 56.7 % 48.5 % 60.5 % 62.1 %

*高耗時得分。

重點:Grok 4.7 在多數工程與專業工作基準測試中領先其自身系列,特別是在長上下文任務方面,同時仍保持與前代產品相同的價格競爭力。


安全性與雙用途控制

  • 新的安全防護系統:發布說明聲稱這是迄今為止最強的拒絕與越獄抵抗能力。
  • HackerBench v0.3:Grok 4.7 僅允許 3.3 % 的高風險雙用途提示通過,同時仍允許合法的安全研究。
  • LatchBio 生物安全基準測試:模型得分 62.4 %,為評估的前沿模型中最高。
  • 紅隊存取:部分資安合作夥伴可獲得邀請制的 Grok 4.7 防禦能力存取權。

定價與可用性

  • 代幣定價:每百萬輸入代幣 2 美元、每百萬輸出代幣 6 美元(與 Grok 4.6 相同)。「快速」版本價格翻倍,輸出速度提升一倍。
  • 存取管道:透過 Cursor、Grok Build、Grok API、第三方程式碼框架以及雲端模型路由器提供。
  • 免費試用:使用者可透過 x.ai/build 嘗試 Grok Build。

社群在 Hacker News 上的反應

正面評價

  • 長時間程式碼執行:使用者報告 Grok 4.6 已能處理複雜的建置根設定;許多使用者預期 4.7 將在此方面進一步提升。
  • 前端開發:多位評論者讚揚 Grok 生成 HTML/CSS/JS 片段的快速能力。
  • 安全性感知:新的安全防護系統被視為雙用途領域的重要進步。

批評與擔憂

  • 代幣效率退步:多位評論者指出輸出代幣消耗大幅上升(例如,CursorBench 得分 46 % 消耗 240 M 代幣,而 4.6 僅需 97 M),顯示模型在定價不變的情況下更不經濟。

    "與 Grok 4.6 相比,代幣效率顯著退步,此說法來自 artificialanalysis.ai 智能指數比較。" – @notduckrabbit

  • 基準測試相關性質疑:部分使用者質疑比較對象的選擇(例如 GPT‑5.6 Sol、Fable 5.1),並忽略中國模型如 Kimi 或 DeepSeek。

    "為什麼比較基準中沒有加入 Kimi、Deepseek 等中國模型?" – @shdtabasum

  • 快取定價不透明:公開定價表僅列出輸入/輸出定價,快取讀取成本則隱藏,引發誘導性定價的指控。

    "每次 Grok 發布都隱藏其快取定價,同時強調輸入/輸出定價……長時間的代理工作流程主要由快取讀取主導。" – @GodelNumbering

  • 效能與成本的權衡:使用者報告快速版本價格翻倍,但速度提升不顯著,且快取罰款使 Grok 比 DeepSeek 4.1 Flash 等替代方案更昂貴。

    "Grok 真的很貴。我用 DeepSeek 4.1 Flash 只花一小部分價格就獲得極佳結果。" – @meerita

  • 基準測試結果參差不齊:雖然 Grok 4.7 在許多任務上超越 4.6,但在某些專門基準測試(如圖像轉 HTML 生成、全知測試)上仍落後於 Astra 和 Gemini 3.8 Flash 等競爭對手。

    "Astra 真是不一樣。雖然貴,但我的任務用的代幣少很多。" – @saejox "Grok 4.7 在 Redactle LLM 排行榜上接近頂端,但仍不如 Gemini 3.8 Flash。" – @pampas

  • 使用者體驗退步:部分早期使用者觀察到回應速度變慢、代幣消耗增加,導致訂閱方案的配額更快耗盡。

    "4.7 肯定更慢也更貴……我今天測試時進展很慢。" – @mchusma


混合反饋對前沿發展的意義

  • 基準提升有限:Grok 4.7 的主要改進(例如 CursorBench 上 +6 %)雖真實存在,但並非革命性;該模型在多項任務上仍落後於頂尖前沿模型。
  • 定價策略至關重要:在輸入/輸出定價不變的情況下增加代幣消耗,可能削弱成本效益,特別是對重度使用者與代理程式而言。
  • 安全性進步是差異化因素:迄今最強的越獄抵抗能力,可能使 Grok 4.7 對受監管產業更具吸引力,儘管其代幣消耗較高。
  • 社群監督日益嚴格:使用者要求提高快取定價、基準測試方法與實際代幣效率的透明度,顯示未來發布需提供更清晰的成本揭露。

總結

Grok 4.7 透過更長的上下文視窗、更好的自我驗證與公司迄今最強的安全防護系統,推動 xAI 的程式碼導向模型向前發展。然而,基準測試提升有限、代幣消耗增加以及快取定價不透明,導致開發者社群反應兩極。該模型的價值主張如今取決於其安全性保證與長時間任務表現,是否能抵消實際工作負載中增加的運營成本。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch