xAI Grok 發佈說明
Grok:即時知識與幽默感
xAI 推出了 Grok,這是一款 AI 助手,旨在以叛逆的風格和幽默感來回答各種問題,其風格模仿了 Hitchhiker’s Guide to the Galaxy。Grok 與其他 AI 系統的不同之處在於,它透過 — — 平台整合了對世界的即時知識,並願意回答其他 AI 模型通常會拒絕的「辛辣」問題。
Grok-1 技術性能
驅動該助手的引擎是 Grok-1,這是一款歷時四個月開發的前沿大型語言模型 (LLM)。它繼承了原型模型 Grok-0 (33B parameters),該模型在僅使用一半訓練資源的情況下,已接近 LLaMA 2 (70B) 的能力。
基準測試結果
Grok-1 展示了強大的推理和編碼能力,超越了其計算規模等級的模型,例如 GPT-3.5 和 Inflection-1。其在標準機器學習基準測試中的表現如下:
| Benchmark | Grok-1 | GPT-3.5 | LLaMa 2 70B | Inflection-1 |
|---|---|---|---|---|
| GSM8k (8-shot) | 62.9% | 57.1% | 56.8% | 62.9% |
| MMLU (5-shot) | 73.0% | 70.0% | 68.9% | 72.7% |
| HumanEval (0-shot) | 63.2% | 48.1% | 29.9% | 35.4% |
| MATH (4-shot) | 23.9% | 23.5% | 13.5% | 16.0% |
真實世界驗證
為了降低來自網路基準測試的數據污染風險,xAI 進行了人工評分評估,使用了 2023 年 5 月匈牙利國家高中數學期末考試題目。Grok-1 獲得了 59% (Grade C) 的分數,表現優於 Claude-2 (55%),僅次於 GPT-4 (68%)。
基礎設施與工程技術
為了支持 Grok-1 的訓練與推理,xAI 開發了使用 Kubernetes, Rust, and JAX 的自定義技術棧。
Rust 被選用於基礎設施層,以確保高性能與可靠性,減少分佈式系統中的錯誤,並允許小規模團隊以極少的監督來維護系統。工程重點放在最大化每瓦特的使用性計算量,並在數萬個 GPU 的規模下,儘管硬體本身具有不穩定性,仍維持高模型算力利用率 (MFU)。
未來研究方向
xAI 將可靠推理識別為主要研究目標,以解決 LLM 生成錯誤或矛盾資訊的傾向。該實驗室正致力於五個關鍵研究領域:
- Scalable Oversight:使用 AI 協助人類透過查閱參考資料和外部工具來驗證複雜的推理與程式碼。
- Formal Verification:整合程式碼正確性的形式化保證,以提高安全性、可靠性與實證性。
- Long-Context Understanding:改進在特定上下文中的有用知識發現與檢索。
- Adversarial Robustness:減少讓優化器在訓練與服務期間利用 AI 系統漏洞的弱點。
- Multimodal Capabilities:增加視覺與音訊感官以實現即時互動。
可用性
截至 2023 年 11 月 3 日,Grok 處於早期 Beta 階段。美國有限數量的用戶可以加入候補名單以獲得原型機的早期訪問權限。
Sources
- OriginalAnnouncing Grok
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch