SpaceXAI Grok 4.6 출시: 지능의 한계와 비용 효율성

Grok 4.6, 높은 비용 효율성으로 지능의 한계에 합류

SpaceXAI의 Grok 4.6은 Artificial Analysis Intelligence Index에서 61점을 기록하며 GPT-5.6 Sol (max)과 어깨를 나란히 했으며, Anthropic의 Claude Opus 5 (63)와 Claude Fable 5 (62)에 이어 세 번째로 높은 점수를 기록했습니다. 이번 출시는 지능 측면에서 큰 도약을 의미하며, Grok 4.5 대비 5점, Grok 4.3 대비 23점 상승했습니다.

에이전트 성능 및 실무 지식 작업

Grok 4.6은 정적인 추론보다는 에이전트 작업에서 가장 강력한 능력을 보여줍니다. GDPval-AA v2 Elo 점수 1753점을 달성하여 Claude Opus 5의 뒤를 잇고 있으며, Claude Fable 5 및 Qwen3.8 Max와 통계적으로 구별할 수 없을 정도의 성능을 보여줍니다.

주요 성능 지표는 다음과 같습니다:

  • $\tau^3$-Banking: 50.7%를 기록하며, 도구 사용을 포함한 멀티턴 고객 서비스 분야에서 Qwen3.8 Max (51.3%)와 함께 상위 2개 모델로 선정되었습니다.
  • Terminal-Bench v2.1: 88.4%를 기록하며, 터미널 기반 소프트웨어 작업에서 선도적인 모델들과 대등한 성능을 보여줍니다.
  • AA-Briefcase: 장기 에이전트 지식 작업에 대한 이 비공개 벤치마크에서 Grok 4.6은 1577 Elo (Fable 5-tier)를 획득했습니다.

특히, Grok 4.6은 턴 효율성이 매우 높습니다. AA-Briefcase에서 Grok 4.6은 약 53턴 만에 작업을 완료하며 평균 ~0.5B 입력 토큰을 사용합니다. 이는 Claude Opus 5 (max)가 약 ~103턴과 ~2.0B 입력 토큰을 사용하는 것과 비교됩니다.

가격 책정 및 작업당 비용 이점

Grok 4.6은 지능의 비약적인 향상에도 불구하고 Grok 4.5와 동일한 헤드라인 가격을 유지합니다. 입력 토큰 1M당 $2, 출력 토큰 1M당 $6로 책정되어, Claude Opus 5 ($5/$25) 및 GPT-5.6 Sol ($5/$30)보다 60% 이상 저렴합니다.

Artificial Analysis에 따르면, Grok 4.6의 작업당 비용은 $0.84로, Intelligence vs. Cost per Task Pareto frontier에 위치합니다. 헤드라인 가격은 동일하게 유지되었으나, 캐시 히트(cache hit) 가격은 Grok 4.5의 1M 토큰당 $0.3에서 Grok 4.6의 1M 토큰당 $0.5로 인상되었습니다.

기술 사양

  • Context Window: 500k tokens (Grok 4.5와 동일).
  • Pricing: $2/$6 per 1M input/output tokens.
  • Cache Hits: $0.5 per 1M tokens.

사용자 관점 및 커뮤니티 인사이트

커뮤니티 토론을 통해 전문적인 워크플로우에서의 모델의 유용성에 대한 사용자 경험과 인식이 갈라지는 것을 확인할 수 있습니다:

  • 코딩 및 생산성: 일부 사용자들은 Grok 4.6이, 특히 Grok build CLI나 Cursor 내에서 사용할 때 Claude Code보다 더 빠르고 상호작용이 활발하다고 보고합니다. 한 사용자는 Grok의 커뮤니케이션 스타일이 더 간결결하고

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch