xAI Grok 发布说明
Grok:实时知识与幽默感
xAI 推出了 Grok,这是一款 AI 助手,旨在以一种带有叛逆色彩和幽默感的风格回答广泛的问题,其设计灵感源自《Hitchhiker’s Guide to the Galaxy》。Grok 通过 — — 平台整合了对世界的实时知识,并愿意回答其他 AI 模型通常会拒绝的“辛辣”问题,从而在其他 AI 系统中脱颖而出。
Grok-1 技术性能
驱动该助手的引擎是 Grok-1,这是一个历时四个月开发的尖端大语言模型 (LLM)。它遵循原型模型 Grok-0 (33B 参数),该模型在仅使用一半训练资源的情况下,其能力已接近 LLaMA 2 (70B)。
基准测试结果
Grok-1 展示了强大的推理和编码能力,超越了同等计算规模的模型,如 GPT-3.5 和 Inflection-1。其在标准机器学习基准测试中的表现如下:
| Benchmark | Grok-1 | GPT-3.5 | LLaMa 2 70B | Inflection-1 |
|---|---|---|---|---|
| GSM8k (8-shot) | 62.9% | 57.1% | 56.8% | 62.9% |
| MMLU (5-shot) | 73.0% | 70.0% | 68.9% | 72.7% |
| HumanEval (0-shot) | 63.2% | 48.1% | 29.9% | 35.4% |
| MATH (4-shot) | 23.9% | 23.5% | 13.5% | 16.0% |
现实世界验证
为了减轻来自基于 Web 的基准测试的数据污染风险,xAI 使用 2023 年 5 月匈牙利国家高中数学期末考试进行了人工评分评估。Grok-1 获得了 59% 的分数 (Grade C),表现优于 Claude-2 (55%),仅次于 GPT-4 (68%)。
基础设施与工程
为了支持 Grok-1 的训练和推理,xAI 开发了一套定制化技术栈,利用了 Kubernetes, Rust, and JAX。
Rust 被选为基础设施层,以确保高性能和可靠性,减少分布式系统中的错误,并允许一个小团队在极少监督的情况下维护系统。工程重点放在了最大化每瓦特有效计算量,并在面对数万个 GPU 规模下硬件固有的不可靠性时,保持高模型浮点运算利用率 (MFU)。
未来研究方向
xAI 将可靠推理确定为主要研究目标,以解决 LLM 生成虚假或矛盾信息的倾向。该实验室正在推进五个关键研究领域:
- Scalable Oversight:使用 AI 协助人类通过查阅参考资料和外部工具来验证复杂的推理和代码。
- Formal Verification:整合代码正确性的形式化保证,以提高安全性、可靠性和落地性。
- Long-Context Understanding:提高在特定上下文中发现和检索有用知识的能力。
- Adversarial Robustness:减少允许优化器在训练和推理过程中利用 AI 系统的漏洞。
- Multimodal Capabilities:增加视觉和音频感官,以实现实时交互。
可用性
截至 2023 年 11 月 3 日,Grok 处于早期测试阶段。美国有限数量的用户可以加入候补名单以获取原型机的早期访问权限。
Sources
- OriginalAnnouncing Grok
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch