Grok-2 Beta 发布

xAI 宣布了 Grok-2 和 Grok-2 mini 的 beta 版本发布,标志着在聊天、编程和推理能力方面较 Grok-1.5 有了显著进步。这些模型目前面向 — Premium 和 Premium+ 用户开放,并将于 2024 年 8 月 月下旬通过企业级 API 发布。

前沿性能与基准测试

Grok-2 在多个学术基准测试中展示了最先进的性能,直接与其他前沿模型竞争。

Grok-2 的早期版本在 LMSYS Chatbot Arena 上以 "sus-column-r" 的名称进行测试,其综合 Elo 分数超过了 Claude 3.5 Sonnet 和 GPT-4 Turbo。AI Tutors 的内部评估侧重于指令遵循和事实准确性,结果显示在工具使用以及利用检索内容进行推理方面有显著改进,特别是在识别缺失信息和丢弃无关帖子方面。

技术基准测试结果

Grok-2 和 Grok-2 mini 在推理、数学、科学和编程方面均比 Grok-1.5 有了实质性的提升。

Benchmark Grok-1.5 Grok-2 mini Grok-2 GPT-4 Turbo Claude 3 Opus Gemini Pro 1.5 Llama 3 405B GPT-4o Claude 3.5 Sonnet
GPQA 35.9% 51.0% 56.0% 48.0% 50.4% 46.2% 51.1% 53.6% 59.6%
MMLU 81.3% 86.2% 87.5% 86.5% 85.7% 85.9% 88.6% 88.7% 88.3%
MMLU-Pro 51.0% 72.0% 75.5% 63.7% 68.5% 69.0% 73.3% 72.6% 76.1%
MATH 50.6% 73.0% 76.1% 72.6% 60.1% 67.7% 73.8% 76.6% 71.1%
HumanEval 74.1% 85.7% 88.4% 87.1% 84.9% 71.9% 89.0% 90.2% 92.0%
MMMU 53.6% 63.2% 66.1% 63.1% 59.4% 62.2% 64.5% 69.1% 68.3%
MathVista 52.8% 68.1% 69.0% 58.1% 50.5% 63.9% 63.8% 67.7%
DocVQA 85.6% 93.2% 93.6% 87.2% 89.3% 93.1% 92.2% 92.8% 95.2%

注:Grok-2 MMLU、MMLU-Pro、MMMU 和 MathVista 是使用 0-shot CoT 进行评估的;MATH 结果为 maj@1;HumanEval 结果为 pass@1。

视觉与多模态能力

Grok-2 在基于视觉的任务中表现出色,特别是在视觉数学推理和基于文档的问题回答方面。

根据基准测试数据,Grok-2 在 MathVista 上达到了 69.0%,在 DocVQA 上达到了 93.6%,在这些领域提供了最先进的性能。xAI 还宣布,多模态理解作为 Grok 体验的核心部分,其预览版将在 — 上推出,且 API 也将很快发布。

集成与可用性

Grok-2 和 Grok-2 mini 已集成到 — 平台,并配备了重新设计的界面和新的功能集。

— Premium 和 Premium+ 用户可以通过 — app 中的 Grok 标签页访问这些模型。Grok-2 作为文本和视觉理解的最先进助手,而 Grok-2 mini 则在速度和质量之间取得了平衡。此外,xAI 正在尝试使用来自 Black Forest Labs 的 FLUX.1 模型来扩展 Grok 在该平台上的能力。

企业级 API 平台

开发者将在 2024 年 8 月下旬通过新的企业级 API 平台获得 Grok-2 和 Grok-2 mini 的访问权限。该 API 基础设施具有以下特点:

  • 多区域推理部署,以实现低延迟的全球访问。
  • 增强的安全性,包括强制性的多因素身份验证(Yubikey、Apple TouchID 或 TOTP)。
  • 管理工具,包括用于将团队、用户和账单管理集成到内部服务的管理 API,以及丰富的流量统计和账单分析功能。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch