xAI Grok リリースノート

Grok: リアルタイムの知識と機知

xAIは、『Hitchhiker’s Guide to the Galaxy』をモデルにした、反抗的な一面とユーモアのセンスを備え、幅広い質問に答えるように設計されたAIアシスタント、Grokを導入しました。Grokは、Xプラットフォームを通じて世界のリアルタイムな知識を統合し、他のAIモデルが通常拒否するような「スパイシーな」質問にも答える意欲があることで、他のAIシステムと一線を画しています。

Grok-1 技術的パフォーマンス

このアシスタントを動かすエンジンは、4ヶ月かけて開発された最先端の大型言語モデル(LLM)であるGrok-1です。これは、プロトタイプモデルであるGrok-0(33Bパラメータ)の後継であり、Grok-0はトレーニングリソースを半分に抑えつつ、LLaMA 2 (70B) の能力に迫る性能を実現していました。

ベンチマーク結果

Grok-1は強力な推論およびコーディング能力を示し、GPT-3.5やInflection-1といった同等の計算クラスのモデルを凌駕しています。標準的な機械学習ベンチマークにおけるパフォーマンスは以下の通りです:

ベンチマーク Grok-1 GPT-3.5 LLaMa 2 70B Inflection-1
GSM8k (8-shot) 62.9% 57.1% 56.8% 62.9%
MMLU (5-shot) 73.0% 70.0% 68.9% 72.7%
HumanEval (0-shot) 63.2% 48.1% 29.9% 35.4%
MATH (4-shot) 23.9% 23.5% 13.5% 16.0%

実世界での検証

ウェブベースのベンチマークによるデータ汚染のリスクを軽減するため、xAIは2023年5月のハンガリーの国家高校数学最終試験を用いた、人間による採点評価を実施しました。Grok-1は59%(Grade C)のスコアを獲得し、Claude-2 (55%)を上回り、GPT-4 (68%)に次ぐ結果となりました。

インフラストラクチャとエンジニアリング

Grok-1のトレーニングと推論をサポートするために、xAIはKubernetes, Rust, and JAXを活用したカスタムスタックを開発しました。

Rustは、高いパフォーマンスと信頼性を確保し、分散システムにおけるバグを減らし、少人数のチームで最小限の監視でシステムを維持できるようにするために、インフラストラクチャ層に採用されました。エンジニアリングの焦点は、ワットあたりの有用な計算量を最大化し、数万個のGPUという規模におけるハードウェア固有の不安定さにもかかわらず、高いModel Flop Utilization (MFU) を維持することに置かれました。

将来の研究方向

xAIは、LLMが誤った情報や矛盾した情報を生成する傾向に対処するため、信頼できる推論を主要な研究目標として特定しています。ラボは以下の5つの主要な研究領域を追求しています:

  1. Scalable Oversight: AIを使用して、リファレンスや外部ツールを参照することで、人間が複雑な推論やコードを検証するのを支援する。
  2. Formal Verification: コードの正確性に対する形式的な保証を統合し、安全性、信頼性、およびグラウンディングを向上させる。
  3. Long-Context Understanding: 特定のコンテキスト内での有用な知識の発見と検索を向上させる。
  4. Adversarial Robustness: 最適化アルゴリズムがトレーニングやサービング中にAIシステムを悪用することを可能にする脆弱性を低減する。
  5. Multimodal Capabilities: リアルタイムのインタラクションを可能にするために、視覚と音声の感覚を追加する。

利用可能性

2023年11月3日現在、Grokは初期ベータ版の段階にあります。米国の限定された数のユーザーが、プロトタイプの早期アクセスに向けたウェイトリストに登録することができます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch