xAI Grok 4.1 Fast 和 Agent Tools API 发布

xAI 推出了 Grok 4.1 Fast 和 Agent Tools API,为开发者提供专门的模型和旨在用于生产级自主智能体的服务器端工具集。此次发布重点在于提高工具调用准确性、减少幻觉,并集成来自 X 平台的实时数据检索。

Grok 4.1 Fast: Specialized Tool-Calling Model

Grok 4.1 Fast 专为企业级用例设计,特别针对金融和客户支持等领域的复杂智能体任务。它具有 200 万 token 的上下文窗口,并针对速度和成本效益进行了优化。

Performance Benchmarks

  • $\tau^2$-bench Telecom: 该模型在此基准测试中获得了 100% 的分数,该测试评估了客户支持场景中的智能体工具使用情况。
  • Berkeley Function Calling v4: Grok 4.1 Fast 以 400 美元的总成本实现了 72% 的整体准确率。
  • Factuality: 与 Grok 4 Fast 相比,该模型将幻觉率降低了一半,同时在 FActScore 基准测试中保持了与 Grok 4 相当的性能。

Long-Context Stability

为了防止随着上下文长度增加而通常会出现的性能下降,xAI 利用了强调多轮对话场景的长程强化学习。这确保了在整个 200 万 token 的上下文窗口中保持一致的性能。

Agent Tools API: Server-Side Infrastructure

The Agent Tools API 提供了一套服务器端工具,允许 Grok 4.1 Fast 作为自主智能体运行,而无需开发者管理自己的 API 密钥、沙箱或检索流水线。这些工具完全在 xAI 基础设施上运行。

Available Toolsets

  • Search Tools: 提供对 X 帖子和通用互联网搜索的实时访问,以获取当前事件和趋势。
  • Files Search: 支持从上传的文件中智能检索相关文档,包括引用。
  • Code Execution: 一个用于执行 Python 代码以进行数据分析和模拟的安全沙箱。
  • MCP Tools: 支持连接到外部 Model Context Protocol (MCP) 服务器,以实现第三方工具集成。

Deep Research and Agentic Search

将 Grok 4.1 Fast 与 Agent Tools API 结合使用,可以在深度研究任务中实现最先进的性能。该模型与 X 生态系统的原生集成在实时信息检索方面提供了显著优势。

Agentic Search Benchmarks

| Benchmark | Grok 4.1 Fast Agent Tools API Score | GPT-5 Score | Claude Sonnet 4.5 Score | Gemini 3 Pro Score | | :--- | :--- | :--- | :--- | :--- | :--- | | Research-Eval Reka | 63.9 | 45.5 | 41.2 | 55.9 | | FRAMES | 87.6 | 86.0 | 85.0 | 90.9 | | X Browse* | 56.3 | 24.2 | 14.6 | 26.5 |

*X Browse 是 xAI 内部的一个基准测试,用于评估在 X 上的多跳搜索和浏览能力。

API Availability and Pricing

xAI 通过 API 提供 Grok 4.1 Fast 的两个变体:

  • grok-4-1-fast-reasoning: 针对最大智能程度进行了优化。
  • grok-4-1-fast-non-reasoning: 针对即时响应进行了优化。

Pricing Structure

| Component | Price | | :--- | :--- | :--- | | Input Tokens | $0.20 / 1M tokens | | Cached Input Tokens | $0.05 / 1M tokens | | Output Tokens | $0.50 / 1M tokens | | Tool Calls | From $5 / 1,000 successful invocations |

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch