xAI Grok 4.7 릴리스: 기능, 벤치마크, 커뮤니티 반응
Grok 4.7은 4.6와 동일한 가격에 더 강력한 장기 컨텍스트 코딩 및 안전성 제공
xAI는 2026년 9월 21일 Grok 4.7을 발표하며, 이 모델이 Grok 라인에서 코딩과 지식 작업에 가장 능력 있는 모델이라고 강조했습니다. Grok 4.6과 동일한 $2 / M 입력 토큰 및 $6 / M 출력 토큰 가격으로 운영되지만, 더 긴 추론 창, 더 나은 자체 검증, 그리고 회사가 출시한 가장 강력한 보안 스택을 자랑합니다.
핵심 기술적 개선 사항
- 더 큰 기본 모델: 커뮤니티의 추측에 따르면 Grok 4.7은 4.6보다 약 40% 더 많은 파라미터를 가진 더 큰 아키텍처를 사용합니다.
- 확장된 RL 훈련: 강화학습 단계가 연장되었으며, 다시간 작업에 더 중점을 두어 장시간 코드 생성을 요구하는 벤치마크(예: CursorBench 4.0)에서 성능이 향상되었습니다.
- 네이티브 Grok Bot 통합: 모델은 이제 Grok Bot 허브를 직접 이해할 수 있어 대화 및 일반 지식 작업에서 성능이 향상됩니다.
- 강화된 자체 검사: 새로운 검증 루프를 통해 모델이 자신의 오류를 더 신뢰성 있게 감지할 수 있게 되었으며, 이는 보고된 안전성 향상의 핵심 요인입니다.
벤치마크 성능 요약
| 벤치마크 | Grok 4.7 | Grok 4.6 | GPT‑5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0 (소프트웨어 공학) | 46.3 % | 40.4 % | 41.7 % | 51.8 % |
| DeepSWE v1.1 (소프트웨어 공학, 고도의 노력) | 71.0 %* | 65.2 % | 72.7 % | 70.0 % |
| EEBench (전기 공학) | 64.0 % | 53.0 % | 39.4 % | 56.4 % |
| AA Briefcase v1.1 (다시간 사무 업무) | 1,657 점 | 1,546 점 | 1,487 점 | 1,678 점 |
| Terminal‑Bench 4.0 (다시간 터미널 작업) | 38.0 % | 20.3 % | 37.3 % | 57.9 % |
| Harvey Legal Agent | 19.6 % | 15.8 % | 2.5 % | 6.7 % |
| HealthBench Professional | 56.7 % | 48.5 % | 60.5 % | 62.1 % |
*고도의 노력 점수.
결론: Grok 4.7은 대부분의 공학 및 전문 업무 벤치마크에서 자신의 라인업을 리드하며, 특히 장기 컨텍스트 작업에서 두각을 나타냅니다. 또한 전신 모델과 가격 경쟁력도 유지하고 있습니다.
안전성 및 이중 용도 제어
- 새로운 보안 스택: 릴리스 노트는 지금까지 가장 강력한 거부 및 잠금 해제 저항력을 자랑합니다.
- HackerBench v0.3: Grok 4.7은 위험한 이중 용도 프롬프트의 3.3%만 통과시키며, 합법적인 보안 연구는 여전히 허용합니다.
- LatchBio 생물안전 벤치마크: 모델은 평가된 최첨단 모델 중 가장 높은 62.4%를 기록했습니다.
- 레드팀 접근권: 일부 사이버보안 파트너는 Grok 4.7의 방어 기능에 초대 제한 접근 권한을 부여받습니다.
가격 및 가용성
- 토큰 가격: $2 / M 입력 토큰, $6 / M 출력 토큰 (Grok 4.6과 동일). "빠른" 버전은 출력 속도를 두 배로 높이기 위해 가격이 두 배입니다.
- 접근 경로: Cursor, Grok Build, Grok API, 제3자 코딩 허브, 클라우드 모델 라우터를 통해 이용 가능합니다.
- 무료 체험: 사용자는 x.ai/build에서 Grok Build를 무료로 시도할 수 있습니다.
Hacker News 커뮤니티 반응
긍정적인 인상
- 장시간 코딩: 사용자들은 Grok 4.6이 이미 복잡한 빌드 루트 설정을 처리할 수 있다고 보고했으며, 4.7이 이를 더욱 향상시킬 것으로 기대합니다.
- 프론트엔드 개발: 여러 사용자가 Grok이 HTML/CSS/JS 스니펫을 빠르게 생성하는 능력을 칭찬했습니다.
- 안전성 인식: 새로운 보안 스택은 이중 용도 분야에서의 진전으로 평가됩니다.
비판 및 우려
토큰 효율성 저하: 여러 사용자가 출력 토큰 소비가 급격히 증가했다고 지적했습니다 (예: 46% CursorBench 점수를 위해 240M 토큰 vs. 4.6의 97M 토큰), 가격이 동일함에도 불구하고 모델이 더 비효율적이라는 의미입니다.
"artificialanalysis.ai 인텔리전스 인덱스 비교에 따르면 Grok 4.6에 비해 토큰 효율성이 크게 저하된 것으로 나타났습니다." – @notduckrabbit
벤치마크의 관련성: 일부 사용자는 비교 대상(예: GPT‑5.6 Sol, Fable 5.1)의 선택과 치미 또는 딥시크 같은 중국 모델의 누락을 의심합니다.
"왜 치미, 딥시크 같은 중국 모델이 비교 벤치마크에 포함되지 않았나요?" – @shdtabasum
캐시 가격 투명성 부족: 공개 가격표에는 입력/출력 비용만 명시되어 있으며, 캐시 읽기 비용은 숨겨져 있어 부정적인 가격 전략이라고 비판받고 있습니다.
"모든 Grok 릴리스에서 캐시 가격을 은폐하면서 입력/출력 가격만 강조합니다… 장시간 에이전트 워크플로우는 캐시 읽기에 의해 주도됩니다." – @GodelNumbering
성능 대 비용의 트레이드오프: 사용자들은 빠른 버전이 비용을 두 배로 늘리지만 비례하는 속도 향상은 없으며, 캐시 패널티로 인해 DeepSeek 4.1 Flash보다 더 비싸다고 보고합니다.
"Grok는 정말 비쌉니다. 저는 DeepSeek 4.1 Flash를 사용해 훨씬 낮은 비용으로 훌륭한 결과를 얻고 있습니다." – @meerita
혼합된 벤치마크 성과: Grok 4.7은 많은 작업에서 4.6을 능가하지만, Astra나 Gemini 3.8 Flash와 같은 특정 전문 벤치마크(예: 이미지 → HTML 생성, 전지식 테스트)에서는 뒤처집니다.
"Astra는 정말 놀랍습니다. 비싸지만 제 작업에 훨씬 적은 토큰을 사용합니다." – @saejox "Grok 4.7은 Redactle LLM 랭킹에서 상위권에 있지만, 여전히 Gemini 3.8 Flash만큼 좋지 않습니다." – @pampas
사용자 경험 저하: 일부 초기 사용자는 응답 속도가 느려지고 토큰 사용량이 증가해 구독 플랜의 할당량이 빠르게 소진된다고 보고했습니다.
"4.7은 확실히 더 느리고 비싸요… 오늘 벤치마크를 테스트하면서 빠른 진전을 이루지 못했습니다." – @mchusma
혼합된 피드백이 최첨단 기술에 의미하는 바
- 벤치마크 성과는 미미함: Grok 4.7의 주요 개선 사항(예: CursorBench에서 +6%)은 실제지만 혁신적이지는 않습니다. 여러 작업에서 최상위 최첨단 모델에 여전히 뒤처지고 있습니다.
- 가격 전략이 중요함: 입력/출력 비용을 유지하면서 토큰 소비량을 늘리는 것은 특히 고도로 사용하는 개발자와 에이전트에게 비용 효율성을 떨어뜨릴 수 있습니다.
- 안전성 향상은 차별화 요소: 지금까지 가장 강력한 잠금 해제 저항력은 높은 토큰 사용에도 불구하고 규제 산업에서 Grok 4.7을 매력적으로 만들 수 있습니다.
- 커뮤니티 감시가 강화됨: 사용자들은 캐시 가격, 벤치마크 방법론, 실제 세계의 토큰 효율성에 대한 투명성을 요구하고 있으며, 이는 향후 릴리스에서 명확한 비용 공개가 필요함을 시사합니다.
결론
Grok 4.7은 더 긴 컨텍스트 창, 더 나은 자체 검증, 그리고 회사가 출시한 가장 견고한 보안 스택을 통해 xAI의 코딩 중심 모델을 한 단계 진전시켰습니다. 그러나 벤치마크 성과의 미미함, 더 높은 토큰 소비, 그리고 투명하지 않은 캐시 가격으로 인해 개발자들 사이에서 분열된 반응이 나왔습니다. 이 모델의 가치 제안은 이제 실제 워크로드에서 그 안전성 보장과 장시간 작업 성능이 증가된 운영 비용을 상쇄할 수 있는지 여부에 달려 있습니다.
Sources
- HNGrok 4.7
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch