xAI Grok 4 发布说明

xAI 已宣布发布 Grok 4,该模型通过扩展的强化学习和原生工具使用,旨在推动前沿智能的边界。该模型现已向 SuperGrok 和 Premium+ 订阅用户开放,同时也可通过 xAI API 使用。

扩展的强化学习与基础设施

Grok 4 的推理能力通过将强化学习(RL)训练扩展至预训练规模而得以发展。这一进步得益于 Colossus 200,000 GPU 集群及其基础设施,以及算法创新,使计算效率提升了 6 倍。

为了提升模型的通用性,xAI 将可验证训练数据的范围从数学和编程扩展到了多个额外领域。这种方法在使用比以往训练运行多一个数量级以上的计算资源的同时,实现了平滑的性能提升。

原生工具使用与 X 平台集成

Grok 4 经过 RL 训练,能够原生使用工具,使其推理能力可借助代码解释器和网络浏览功能进行增强。该模型可自主确定自己的搜索查询,从网络各处合成高质量响应。

与 X 平台的集成是核心功能之一,使 Grok 4 能够使用高级关键词和语义搜索工具,以及媒体分析功能,从 X 平台内部获取实时信息。

Grok 4 Heavy 与并行推理时计算

Grok 4 Heavy 是该模型的一个专用版本,利用并行推理时计算,使其能够同时考虑多个假设。该变体在可靠性与复杂推理方面树立了新的性能标准:

  • 人类最后的考试:Grok 4 Heavy 是首个在该专家级基准测试中得分达到 50%(文本子集具体得分为 50.7%)的模型。
  • 学术基准测试:该模型在大多数学术基准测试中已达到饱和水平。

前沿智能基准测试

Grok 4 在多个高难度闭源模型基准测试中展现出顶尖性能:

  • ARC-AGI V2:达到 15.9%,几乎是 Claude Opus 的 ~8.6% 的两倍。
  • Vending-Bench(代理型):实现净收益 4,694.15 美元,售出 4,569 件商品,显著优于 Claude Opus 4(2,077.41 美元)和人类(844.05 美元)。
  • USAMO'25:Grok 4 Heavy 以 61.9 分领先。

API 功能与企业级安全

Grok 4 API 为开发者提供多模态理解能力以及 256,000 个 token 的上下文窗口。主要功能包括:

  • 实时搜索 API:集成跨 X、网络和新闻源的实时数据搜索功能。
  • 合规性:API 已通过 SOC 2 Type 2、GDPR 和 CCPA 认证。
  • 可用性:该模型即将上线超大规模云服务商合作伙伴,用于企业部署。

多模态语音与视觉模式

xAI 推出了升级版语音模式,具备更高的真实感和响应速度。该模式包含新语音和重新设计的对话界面。

此外,Grok 4 现在可处理实时视觉输入。通过在语音聊天中启用视频,模型可实时分析用户的摄像头画面,并基于所见内容提供洞察。该功能基于内部开发的强化学习框架和语音压缩技术实现。

未来路线图

xAI 计划继续扩展强化学习,从受控领域中的可验证奖励,迈向解决动态环境中复杂现实问题。未来开发将聚焦于提升视觉与音频的多模态整合,以创建更直观、高效的 AI 系统。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch