xAI Grok 4.7 릴리스 노트

xAI는 복잡한 코딩 및 전문 지식 작업에 특별히 최적화된 Grok 4.7을 출시했습니다. 이 모델은 Grok 4.6의 후속 버전으로, 더 큰 기본 모델과 몇 시간이 걸리는 작업을 요구하는 과제에 초점을 맞춘 훈련 방식을 활용하여 성능을 향상시켰습니다.

기술적 개선 및 훈련

Grok 4.7은 Grok 4.6보다 더 큰 기본 모델을 기반으로 하며, 확장된 강화 학습 실행을 통해 훈련되었습니다. 이 훈련은 더 어려운 과제 조합에 초점을 맞추었으며, 특히 수시간이 걸리는 문제에 더 높은 가중치를 두어 모델이 자체 작업을 더 잘 검증하고 더 긴 컨텍스트를 관리할 수 있도록 했습니다.

또한 xAI는 Grok 4.7이 Grok Bot 허니스를 원천적으로 이해하도록 훈련시켜 일반 지식 작업 및 대화형 과제에서의 성능을 향상시켰습니다.

성능 벤치마크

Grok 4.7은 여러 전문적 및 기술적 벤치마크에서 Grok 4.6보다 상당한 개선을 보였습니다. 특히 장시간 실행 코딩 작업에 대한 CursorBench 4.0에서 가격 대비 성능 측면에서 매우 경쟁력 있는 옵션으로 자리매김하고 있습니다.

소프트웨어 및 전기공학

  • CursorBench 4.0: Grok 4.7은 46.3%를 기록했으며, Grok 4.6의 40.4%를 상회했습니다.
  • DeepSWE v1.1: Grok 4.7은 71.0% (고도의 노력)를 달성해 Grok 4.6의 65.2%를 능가했습니다.
  • EEBench: Grok 4.7은 64.0%를 기록해 Grok 4.6의 53.0%와 GPT-5.6 Sol Max의 39.4%보다 훨씬 높았습니다.

전문 지식 작업

  • AA Briefcase v1.1: Grok 4.7은 1,657점을 기록해 Grok 4.6의 1,546점을 상회했습니다.
  • Harvey Legal Agent Benchmark: Grok 4.7은 19.6%를 기록해 Grok 4.6의 15.8%보다 크게 향상되었으며, GPT-5.6 Sol Max의 2.5%와 Fable 5.1 Max의 6.7%를 크게 앞섰습니다.
  • HealthBench Professional: Grok 4.7은 56.7%를 기록해 Grok 4.6의 48.5%를 상회했습니다.
  • Terminal-Bench 4.0: Grok 4.7은 38.0%를 기록해 Grok 4.6의 20.3%를 상회했습니다.

안전성 및 사이버 보안

Grok 4.7은 완전히 새로운 보안 스택을 구현하여, xAI가 테스트한 모델 중 가장 강력한 잠금 해제 저항성과 거부 능력을 갖추고 있습니다.

생물안전 및 사이버 방어

  • 생물안전: 모델은 LatchBio의 생물안전 벤치마크에서 62.4%로 최고 점수를 기록했습니다.
  • 사이버 보안: HackerBench v0.3에서 Grok 4.7은 위험한 이중용도 프롬프트의 3.3%만 통과시켰으며, 합법적인 보안 작업에 대한 거부율은 낮은 수준을 유지했습니다.

방어 연구를 지원하기 위해 xAI는 특정 사이버 보안 파트너에게 모델의 레드팀 기능에 대한 초대형 액세스를 제공하고 있습니다.

가격 및 가용성

Grok 4.7은 Grok API, Grok Build, Cursor, 제3자 코딩 허니스, 모델 라우터 및 클라우드 플랫폼을 통해 이용 가능합니다.

가격 구조:

  • 표준: 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $6.
  • 빠른 버전: 표준 버전의 두 배의 출력 속도를 제공하지만 가격도 두 배입니다.

Sources