Grok 4.5 릴리스 노트

xAI는 고성능 코딩, 에이전트 작업 및 지식 작업을 위한 모델인 Grok 4.5를 출시했습니다. 이 모델은 xAI가 현재까지 개발한 가장 강력한 모델로, Cursor와의 협업을 통해 개발되었습니다.

엔지니어링 및 코딩 성능

Grok 4.5는 실제 엔지니어링 작업에서 강력한 능력을 보여주며, 특히 소프트웨어 엔지니어링 벤치마크에서 뛰어난 성능을 기록했습니다. 특정 해결률에서는 여러 선도적인 모델을 앞서지만, 다양한 평가 허브에서 성능이 다소 차이가 있습니다.

벤치마크 결과

  • SWE Marathon (pass@1): Grok 4.5는 29.0%의 해결률을 기록하여 Opus 4.8 (max)의 26.0%와 Fable (max)의 24.0%를 초과했습니다.
  • Terminal Bench 2.1: Grok 4.5는 83.3%를 기록하여 Fable (max)의 84.3%와 GPT 5.5 (xhigh)의 83.4%에 근접했습니다.
  • SWE Bench Pro: Grok 4.5는 64.7%의 해결률을 기록하여 Opus 4.7 (max)의 64.3%, GLM 5.2의 62.1%, GPT 5.5 (xhigh)의 58.6%를 상회했습니다.
  • DeepSWE 1.0: Grok 4.5는 62.0%를 기록하여 Fable (max)의 66.1%와 GPT 5.5 (xhigh)의 64.31%에 뒤졌습니다.
  • DeepSWE 1.1: Grok 4.5는 53%를 기록하여 Fable (max)의 70%, GPT 5.5 (xhigh)의 67%, Opus 4.8 (max)의 59%에 뒤졌습니다.

기술적 훈련 및 인프라

Grok 4.5는 수만 개의 NVIDIA GB300 GPU를 사용하여 훈련되었습니다. 훈련 과정에서는 데이터의 양보다 품질을 우선시하기 위해 중복 제거, 품질 평가, 도메인 중심 선택을 통해 고신호 데이터 혼합을 유지했습니다.

강화 학습 및 에이전트 기능

토큰당 지능을 향상시키기 위해 xAI는 수십만 개의 작업에 걸쳐 강화 학습(RL)을 확장했습니다. 이 RL 훈련은 자동화 및 모델 기반 평가를 사용하여 다단계 소프트웨어 엔지니어링 및 기술 작업에 집중했습니다. 훈련 스택은 매우 비동기적인 운영을 지원하여, GPU 클러스터 전체에서 학습이 지속되는 동안 에이전트 배포가 수 시간 동안 실행될 수 있습니다.

효율성 및 서빙 속도

Grok 4.5는 초당 80토큰(TPS)의 속도로 제공됩니다. 경쟁 모델에 비해 높은 토큰 효율성을 특징으로 하며, 작업 해결에 훨씬 적은 토큰을 필요로 합니다.

SWE Bench Pro 작업에서 Grok 4.5는 평균 15,954개의 출력 토큰으로 작업을 해결하며, 이는 Opus 4.8 (max)가 필요로 하는 67,020개 토큰보다 약 4.2배 적은 수치입니다.

사무 생산성 및 통합

Grok 4.5는 Grok Build의 기본 모델이며 Cursor에 통합되어 있습니다. 이를 통해 기술적 능력을 사무 소프트웨어로 확장하며, 다음과 같은 기능을 제공합니다:

  • Excel: 웹 검색, 다중 시트 수식, 내부 노트를 활용한 복잡한 모델 구축
  • PowerPoint: 내장 도형을 사용한 복잡한 다이어그램 생성 및 슬라이드 콘텐츠 설계
  • Word: 명확한 글쓰기 및 비즈니스 리뷰 개요 작성

가격 및 이용 가능 여부

  • 가격: 입력 토큰은 100만 단위당 $2, 출력 토큰은 100만 단위당 $6입니다.
  • 이용 가능 여부: Grok Build, Cursor(모든 플랜), SpaceXAI 콘솔 API를 통해 이용 가능합니다.

Sources

관련