xAI Grok 4.7 릴리스: 기능, 벤치마크, 커뮤니티 반응

Grok 4.7은 4.6와 동일한 가격에 더 강력한 장기 컨텍스트 코딩 및 안전성 제공

xAI는 2026년 9월 21일 Grok 4.7을 발표하며, 이 모델이 Grok 라인에서 코딩과 지식 작업에 가장 능력 있는 모델이라고 강조했습니다. Grok 4.6과 동일한 $2 / M 입력 토큰 및 $6 / M 출력 토큰 가격으로 운영되지만, 더 긴 추론 창, 더 나은 자체 검증, 그리고 회사가 출시한 가장 강력한 보안 스택을 자랑합니다.


핵심 기술적 개선 사항

  • 더 큰 기본 모델: 커뮤니티의 추측에 따르면 Grok 4.7은 4.6보다 약 40% 더 많은 파라미터를 가진 더 큰 아키텍처를 사용합니다.
  • 확장된 RL 훈련: 강화학습 단계가 연장되었으며, 다시간 작업에 더 중점을 두어 장시간 코드 생성을 요구하는 벤치마크(예: CursorBench 4.0)에서 성능이 향상되었습니다.
  • 네이티브 Grok Bot 통합: 모델은 이제 Grok Bot 허브를 직접 이해할 수 있어 대화 및 일반 지식 작업에서 성능이 향상됩니다.
  • 강화된 자체 검사: 새로운 검증 루프를 통해 모델이 자신의 오류를 더 신뢰성 있게 감지할 수 있게 되었으며, 이는 보고된 안전성 향상의 핵심 요인입니다.

벤치마크 성능 요약

벤치마크 Grok 4.7 Grok 4.6 GPT‑5.6 Sol Fable 5.1
CursorBench 4.0 (소프트웨어 공학) 46.3 % 40.4 % 41.7 % 51.8 %
DeepSWE v1.1 (소프트웨어 공학, 고도의 노력) 71.0 %* 65.2 % 72.7 % 70.0 %
EEBench (전기 공학) 64.0 % 53.0 % 39.4 % 56.4 %
AA Briefcase v1.1 (다시간 사무 업무) 1,657 점 1,546 점 1,487 점 1,678 점
Terminal‑Bench 4.0 (다시간 터미널 작업) 38.0 % 20.3 % 37.3 % 57.9 %
Harvey Legal Agent 19.6 % 15.8 % 2.5 % 6.7 %
HealthBench Professional 56.7 % 48.5 % 60.5 % 62.1 %

*고도의 노력 점수.

결론: Grok 4.7은 대부분의 공학 및 전문 업무 벤치마크에서 자신의 라인업을 리드하며, 특히 장기 컨텍스트 작업에서 두각을 나타냅니다. 또한 전신 모델과 가격 경쟁력도 유지하고 있습니다.


안전성 및 이중 용도 제어

  • 새로운 보안 스택: 릴리스 노트는 지금까지 가장 강력한 거부 및 잠금 해제 저항력을 자랑합니다.
  • HackerBench v0.3: Grok 4.7은 위험한 이중 용도 프롬프트의 3.3%만 통과시키며, 합법적인 보안 연구는 여전히 허용합니다.
  • LatchBio 생물안전 벤치마크: 모델은 평가된 최첨단 모델 중 가장 높은 62.4%를 기록했습니다.
  • 레드팀 접근권: 일부 사이버보안 파트너는 Grok 4.7의 방어 기능에 초대 제한 접근 권한을 부여받습니다.

가격 및 가용성

  • 토큰 가격: $2 / M 입력 토큰, $6 / M 출력 토큰 (Grok 4.6과 동일). "빠른" 버전은 출력 속도를 두 배로 높이기 위해 가격이 두 배입니다.
  • 접근 경로: Cursor, Grok Build, Grok API, 제3자 코딩 허브, 클라우드 모델 라우터를 통해 이용 가능합니다.
  • 무료 체험: 사용자는 x.ai/build에서 Grok Build를 무료로 시도할 수 있습니다.

Hacker News 커뮤니티 반응

긍정적인 인상

  • 장시간 코딩: 사용자들은 Grok 4.6이 이미 복잡한 빌드 루트 설정을 처리할 수 있다고 보고했으며, 4.7이 이를 더욱 향상시킬 것으로 기대합니다.
  • 프론트엔드 개발: 여러 사용자가 Grok이 HTML/CSS/JS 스니펫을 빠르게 생성하는 능력을 칭찬했습니다.
  • 안전성 인식: 새로운 보안 스택은 이중 용도 분야에서의 진전으로 평가됩니다.

비판 및 우려

  • 토큰 효율성 저하: 여러 사용자가 출력 토큰 소비가 급격히 증가했다고 지적했습니다 (예: 46% CursorBench 점수를 위해 240M 토큰 vs. 4.6의 97M 토큰), 가격이 동일함에도 불구하고 모델이 더 비효율적이라는 의미입니다.

    "artificialanalysis.ai 인텔리전스 인덱스 비교에 따르면 Grok 4.6에 비해 토큰 효율성이 크게 저하된 것으로 나타났습니다." – @notduckrabbit

  • 벤치마크의 관련성: 일부 사용자는 비교 대상(예: GPT‑5.6 Sol, Fable 5.1)의 선택과 치미 또는 딥시크 같은 중국 모델의 누락을 의심합니다.

    "왜 치미, 딥시크 같은 중국 모델이 비교 벤치마크에 포함되지 않았나요?" – @shdtabasum

  • 캐시 가격 투명성 부족: 공개 가격표에는 입력/출력 비용만 명시되어 있으며, 캐시 읽기 비용은 숨겨져 있어 부정적인 가격 전략이라고 비판받고 있습니다.

    "모든 Grok 릴리스에서 캐시 가격을 은폐하면서 입력/출력 가격만 강조합니다… 장시간 에이전트 워크플로우는 캐시 읽기에 의해 주도됩니다." – @GodelNumbering

  • 성능 대 비용의 트레이드오프: 사용자들은 빠른 버전이 비용을 두 배로 늘리지만 비례하는 속도 향상은 없으며, 캐시 패널티로 인해 DeepSeek 4.1 Flash보다 더 비싸다고 보고합니다.

    "Grok는 정말 비쌉니다. 저는 DeepSeek 4.1 Flash를 사용해 훨씬 낮은 비용으로 훌륭한 결과를 얻고 있습니다." – @meerita

  • 혼합된 벤치마크 성과: Grok 4.7은 많은 작업에서 4.6을 능가하지만, Astra나 Gemini 3.8 Flash와 같은 특정 전문 벤치마크(예: 이미지 → HTML 생성, 전지식 테스트)에서는 뒤처집니다.

    "Astra는 정말 놀랍습니다. 비싸지만 제 작업에 훨씬 적은 토큰을 사용합니다." – @saejox "Grok 4.7은 Redactle LLM 랭킹에서 상위권에 있지만, 여전히 Gemini 3.8 Flash만큼 좋지 않습니다." – @pampas

  • 사용자 경험 저하: 일부 초기 사용자는 응답 속도가 느려지고 토큰 사용량이 증가해 구독 플랜의 할당량이 빠르게 소진된다고 보고했습니다.

    "4.7은 확실히 더 느리고 비싸요… 오늘 벤치마크를 테스트하면서 빠른 진전을 이루지 못했습니다." – @mchusma


혼합된 피드백이 최첨단 기술에 의미하는 바

  • 벤치마크 성과는 미미함: Grok 4.7의 주요 개선 사항(예: CursorBench에서 +6%)은 실제지만 혁신적이지는 않습니다. 여러 작업에서 최상위 최첨단 모델에 여전히 뒤처지고 있습니다.
  • 가격 전략이 중요함: 입력/출력 비용을 유지하면서 토큰 소비량을 늘리는 것은 특히 고도로 사용하는 개발자와 에이전트에게 비용 효율성을 떨어뜨릴 수 있습니다.
  • 안전성 향상은 차별화 요소: 지금까지 가장 강력한 잠금 해제 저항력은 높은 토큰 사용에도 불구하고 규제 산업에서 Grok 4.7을 매력적으로 만들 수 있습니다.
  • 커뮤니티 감시가 강화됨: 사용자들은 캐시 가격, 벤치마크 방법론, 실제 세계의 토큰 효율성에 대한 투명성을 요구하고 있으며, 이는 향후 릴리스에서 명확한 비용 공개가 필요함을 시사합니다.

결론

Grok 4.7은 더 긴 컨텍스트 창, 더 나은 자체 검증, 그리고 회사가 출시한 가장 견고한 보안 스택을 통해 xAI의 코딩 중심 모델을 한 단계 진전시켰습니다. 그러나 벤치마크 성과의 미미함, 더 높은 토큰 소비, 그리고 투명하지 않은 캐시 가격으로 인해 개발자들 사이에서 분열된 반응이 나왔습니다. 이 모델의 가치 제안은 이제 실제 워크로드에서 그 안전성 보장과 장시간 작업 성능이 증가된 운영 비용을 상쇄할 수 있는지 여부에 달려 있습니다.

Sources

관련