xAI Grok 4.1 Fast and Agent Tools API 發佈

xAI 推出了 Grok 4.1 Fast 和 Agent Tools API,為開發者提供專門的模型與伺服器端工具集,旨在用於生產級別的自主代理(autonomous agents)。此次發佈重點在於提高工具調用(tool-calling)的準確性、減少幻覺,並整合來自 X 平台的即時數據檢索。

Grok 4.1 Fast:專門的工具調用模型

Grok 4.1 Fast 是為企業級應用場景設計的,特別針對金融和客戶支援等領域中的複雜代理任務。它具備 200 萬 token 的上下文窗口,並針對速度與成本效益進行了優化。

性能基準測試

  • $\tau^2$-bench Telecom:該模型在此基準測試中獲得了 100% 的分數,該測試用於評估客戶支援場景中的代理工具使用能力。
  • Berkeley Function Calling v4:Grok 4.1 Fast 以 400 美元的總成本實現了 72% 的整體準確度。
  • Factuality:與 Grok 4 Fast 相比,該模型將幻覺率降低了一半,同時在 FActScore 基準測試中保持與 Grok 4 相當的性能。

長上下文穩定性

為了防止通常隨上下文長度增加而出現的性能下降,xAI 利用了強調多輪對話場景的長時程強化學習(long-horizon reinforcement learning)。這確保了在整個 200 萬 token 的上下文窗口中都能保持一致的性能。

Agent Tools API:伺服器端基礎設施

Agent Tools API 提供了一套伺服器端工具,讓 Grok 4.1 Fast 可以作為自主代理運行,而無需開發者自行管理 API 金鑰、沙盒或檢索管道。這些工具完全運行在 xAI 的基礎設施上。

可用的工具集

  • Search Tools:提供對 X 貼文和一般網路搜尋的即時存取,用於獲取時事與趨勢。
  • Files Search:能夠從上傳的文件中智能檢索相關文件,包括引用來源。
  • Code Execution:一個用於執行 Python 代碼以進行數據分析和模擬的安全沙盒。
  • MCP Tools:支持連接到外部 Model Context Protocol (MCP) 伺服器,以進行第三方工具整合。

深度研究與代理式搜尋

將 Grok 4.1 Fast 與 Agent Tools API 結合使用,可在深度研究任務中實現頂尖的性能。該模型與 X 生態系統的原生整合為即時信息檢索提供了顯著優勢。

代理式搜尋基準測試

Benchmark Grok 4.1 Fast Agent Tools API Score GPT-5 Score Claude Sonnet 4.5 Score Gemini 3 Pro Score
Research-Eval Reka 63.9 45.5 41.2 55.9
FRAMES 87.6 86.0 85.0 90.9
X Browse* 56.3 24.2 14.6 26.5

*X Browse 是 xAI 內部的基準測試,用於評估在 X 上的多跳搜尋與瀏覽能力。

API 可用性與定價

xAI 透過 API 提供 Grok 4.1 Fast 的兩種變體:

  • grok-4-1-fast-reasoning: 優化用於極大化智能。
  • grok-4-1-fast-non-reasoning: 優化用於即時響應。

定價結構

Component Price
Input Tokens $0.20 / 1M tokens
Cached Input Tokens $0.05 / 1M tokens
Output Tokens $0.50 / 1M tokens
Tool Calls From $5 / 1,000 successful invocations

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch