xAI Grok 4 릴리스 노트

xAI는 확장된 강화 학습과 내장 도구 사용을 통해 최전방 지능의 경계를 넘어서는 모델인 Grok 4의 출시를 발표했습니다. 이 모델은 SuperGrok 및 Premium+ 구독자에게 제공되며, xAI API를 통해도 이용 가능합니다.

확장된 강화 학습 및 인프라

Grok 4의 추론 능력은 사전 학습 규모에까지 확장된 강화 학습(RL) 학습을 통해 개발되었습니다. 이 발전은 Colossus 200,000 GPU 클러스터 및 인프라, 알고리즘 혁신을 통해 계산 효율성을 6배 향상시킨 데 기반합니다.

모델의 유연성을 향상시키기 위해 xAI는 수학과 코딩을 넘어 여러 추가 도메인으로 확장된 검증 가능한 학습 데이터를 활용했습니다. 이 접근 방식은 이전 학습보다 10배 이상 많은 컴퓨팅 자원을 사용하면서도 부드러운 성능 향상을 가져왔습니다.

내장 도구 사용 및 X 통합

Grok 4는 강화 학습을 통해 도구를 내장 방식으로 사용하도록 훈련되어, 코드 인터프리터와 웹 브라우징을 통해 추론을 보완할 수 있습니다. 모델은 웹 전반에서 고품질 응답을 합성하기 위해 자체적으로 검색 쿼리를 결정합니다.

X 플랫폼과의 통합은 핵심 기능으로, Grok 4가 고급 키워드 및 의미 기반 검색 도구, 미디어 분석 기능을 활용하여 X 내부에서 실시간 정보를 검색할 수 있도록 합니다.

Grok 4 Heavy 및 병렬 테스트 시 계산

Grok 4 Heavy는 병렬 테스트 시 계산을 활용하는 특화된 버전으로, 동시에 여러 가설을 고려할 수 있습니다. 이 변종은 신뢰성과 복잡한 추론에서 새로운 성능 기준을 설정합니다:

  • 인류의 마지막 시험: Grok 4 Heavy는 이 전문 수준 벤치마크에서 처음으로 50% (특히 텍스트 전용 하위 집합에서 50.7%)를 기록했습니다.
  • 학술 벤치마크: 모델은 대부분의 학술 벤치마크에서 포화 상태에 도달했습니다.

최전방 지능 벤치마크

Grok 4는 폐쇄형 모델을 위한 몇 가지 고난도 벤치마크에서 최첨단 성능을 보여줍니다:

  • ARC-AGI V2: 15.9%를 달성하여 Claude Opus의 약 8.6%에 비해 거의 두 배에 가까운 성능을 보였습니다.
  • Vending-Bench (Agentic): 순자산 $4,694.15, 판매량 4,569개를 기록하며, Claude Opus 4($2,077.41)와 인간($844.05)을 크게 앞섰습니다.
  • USAMO'25: Grok 4 Heavy가 61.9점으로 선두를 달리고 있습니다.

API 기능 및 기업 보안

Grok 4 API는 개발자들에게 다중 모달 이해 능력과 256,000 토큰의 컨텍스트 창을 제공합니다. 주요 기능은 다음과 같습니다:

  • 실시간 검색 API: X, 웹, 뉴스 소스를 아우르는 실시간 데이터 검색을 통합합니다.
  • 준수성: API는 SOC 2 Type 2, GDPR, CCPA 인증을 받았습니다.
  • 가용성: 모델은 기업용 배포를 위해 하이퍼스케일러 파트너에게 곧 제공될 예정입니다.

다중 모달 음성 및 시각 모드

xAI는 향상된 현실감과 반응성으로 업그레이드된 음성 모드를 도입했습니다. 이 모드는 새 음성과 재설계된 대화 인터페이스를 포함합니다.

또한 Grok 4는 실시간 시각 입력을 처리할 수 있게 되었습니다. 음성 채팅 중 비디오를 활성화하면 모델이 사용자의 카메라 피드를 실시간으로 분석하고, 보는 내용에 기반한 통찰을 제공할 수 있습니다. 이 기능은 내부 RL 프레임워크와 음성 압축 기술을 사용해 개발되었습니다.

미래 로드맵

xAI는 제한된 도메인 내 검증 가능한 보상에서 벗어나, 동적 환경에서 복잡한 실제 문제를 해결할 수 있도록 강화 학습을 지속적으로 확장할 계획입니다. 향후 개발은 시각과 음성의 다중 모달 통합을 개선하여 더 직관적이고 효율적인 AI 시스템을 만드는 데 집중할 것입니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch