xAI 그록 릴리스 노트

그록: 실시간 지식과 유머감각

xAI는 해치하이커의 안내서를 모델로 삼아, 다양한 질문에 반항적인 성향과 유머 감각을 가지고 답하는 AI 어시스턴트인 그록을 발표했습니다. 그록은 일반적으로 다른 AI 모델이 거부하는 '스파이시한' 질문에 답하려는 의지와 함께, — — 플랫폼을 통해 세계의 실시간 지식을 통합함으로써 다른 AI 시스템과 차별화됩니다.

그록-1 기술 성능

어시스턴트를 구동하는 엔진은 그록-1로, 4개월간 개발된 프론티어 대규모 언어 모델(LLM)입니다. 이 모델은 트레이닝 자원의 절반만 사용하면서도 LLaMA 2 (70B) 수준의 성능에 근접한 프로토타입 모델인 그록-0 (33B 파라미터)을 기반으로 합니다.

벤치마크 결과

그록-1은 강력한 추론 및 코딩 능력을 보이며, GPT-3.5와 Inflection-1과 같은 컴퓨팅 클래스의 모델들을 능가합니다. 표준 기계학습 벤치마크에서의 성능은 다음과 같습니다:

벤치마크 그록-1 GPT-3.5 LLaMa 2 70B Inflection-1
GSM8k (8-shot) 62.9% 57.1% 56.8% 62.9%
MMLU (5-shot) 73.0% 70.0% 68.9% 72.7%
HumanEval (0-shot) 63.2% 48.1% 29.9% 35.4%
MATH (4-shot) 23.9% 23.5% 13.5% 16.0%

실제 환경 검증

웹 기반 벤치마크에서의 데이터 오염 위험을 줄이기 위해, xAI는 2023년 5월 헝가리 고등학교 수학 국가 시험을 활용한 인간 평가를 실시했습니다. 그록-1은 59% (등급 C)를 기록하며, 클로드-2 (55%)를 앞섰고, GPT-4 (68%)에 비해 뒤졌습니다.

인프라 및 엔지니어링

그록-1의 트레이닝과 추론을 지원하기 위해, xAI는 Kubernetes, Rust, JAX를 활용한 커스텀 스택을 개발했습니다.

Rust는 고성능과 신뢰성을 보장하기 위해 인프라 계층에 선택되었으며, 분산 시스템 내 버그를 줄이고 소규모 팀이 최소한의 감독으로 시스템을 유지할 수 있도록 했습니다. 엔지니어링 초점은 수만 개의 GPU 규모에서의 하드웨어의 본질적인 불안정성에도 불구하고, 와트당 유용한 컴퓨팅을 최대화하고 높은 모델 플롭 활용도(MFU)를 유지하는 데 두었습니다.

미래 연구 방향

xAI는 LLM이 잘못되거나 모순된 정보를 생성하는 경향을 해결하기 위해, 신뢰할 수 있는 추론을 주요 연구 목표로 삼고 있습니다. 연구실은 다섯 가지 핵심 연구 분야를 추진하고 있습니다:

  1. 확장 가능한 감시: 참조 및 외부 도구를 검색함으로써 AI가 인간이 복잡한 추론과 코드를 검증하는 데 도움을 주는 방식.
  2. 형식적 검증: 코드 정확성에 대한 형식적 보장을 통합하여 안전성, 신뢰성, 지각력을 향상.
  3. 장문맥 이해: 특정 맥락 내에서 유용한 지식을 탐색하고 검색하는 능력 향상.
  4. 적대적 강건성: 트레이닝 및 서비스 중 최적화 도구가 AI 시스템을 악용할 수 있는 취약성 감소.
  5. 다중모달 기능: 시각 및 음성 감각을 추가하여 실시간 상호작용 가능하게 함.

가용성

2023년 11월 3일 기준, 그록은 초기 베타 단계에 있습니다. 미국 내 제한된 수의 사용자가 프로토타입에 조기 접근하기 위한 대기자 명단에 가입할 수 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch