Grok 4.6 릴리스 노트: 에이전트 코딩 및 프런티어 인텔리전스
Grok 4.6은 에이전트 워크플로우를 위한 프런티어 인텔리전스를 제공합니다
Grok 4.6은 장기 실행 에이전트와 야심 찬 인터랙티브 및 비주얼 작업을 위해 특별히 설계되었으며, 모델이 여러 단계에 걸쳐 복잡한 작업을 지속할 수 있도록 합니다. 이 모델은 주제 조사, 정보 분석, 대규모 코드베이스 탐색, 제품 아이디어를 완성도 높은 애플리케이션으로 변환하는 데 특히 효과적입니다.
9개의 벤치마크 종합 점수인 Artificial Analysis Intelligence Index에서 Grok 4.6은 61점을 기록하며 GPT-5.6 Sol의 성능과 대등한 수준을 보여줍니다. 또한 에이전트 코딩 및 지식 작업 벤치마크에서 강력한 성능을 입증하며, 특히 다음 분야에서 Grok 4.5 대비 향상된 성능을 보여줍니다:
- GDPVal-AA v2: 1753 (Grok 4.5의 1526에서 상승)
- CursorBench v3.2: 69.9% (Grok 4.5의 66.7%에서 상승)
- DeepSWE v1.1: 65.9% (Grok 4.5의 54%에서 상승)
- FrontierCode v1.1 (Extended): 61.3% (Grok 4.5의 56.6%에서 상승)
- APEX-Agents: 57.5% (Grok 4.5의 47.1%에서 상승)
훈련 및 RL에서의 기술적 개선 사항
Grok 4.6은 추론 및 기술적 역량을 향상시키기 위해 더 긴 보충 훈련 실행과 정교한 데이터 큐레이션을 활용합니다. 훈련 프로세스에는 다음과 같은 몇 가지 핵심 단계가 포함되었습니다:
- 기초 훈련 (Foundation Training): xAI는 고급 기술 개념 및 추론을 위해 큐레이션된 모델 생성 데이터를 사용했으며, 이를 고품질 엔지니어링 데이터 및 개선된 옵티마이저/훈련 레시피와 결합했습니다.
- SFT (Supervised Fine-Tuning): Grok 4.5를 사용하여 STEM, 소프트웨어 엔지니어링 및 지식 작업 전반에 걸친 SFT 궤적을 재생성했습니다. 그 후 모델 기반 체크를 사용하여 문제가 있는 트레이스를 필터링했습니다.
- 에이전트 RL (Agentic RL): 모델은 일반 코딩과 웹 개발, 커널 최적화 및 컴퓨터 지원 설계(CAD)를 위한 도메인별 환경을 포함한 광범위한 강화 학습 작업에 대해 훈련되었습니다.
프로젝트 개발을 위한 강화된 기능
Grok 4.6은 광범위한 제품 아이디어를 최소한의 반복으로 작동하는 첫 번째 버전으로 전환하도록 최적화되었습니다. 이 모델은 Grok 4.5와 비교했을 때 단 한 번의 패스로 애플리케이션의 구조와 시각적 언어를 설정하는 더 강력한 능력을 보여줍니다.
주요 행동 개선 사항은 다음과 같습니다:
- 자기 검증 (Self-Verification): 더 긴 궤적에서 모델은 다음 단계로 넘어가기 전에 작업에 대한 셀프 테스트 및 검증을 더 빈번하게 수행합니다.
- 시각적/인터랙티브 강점: 모델은 시각적 프로젝트에 대해 더 높은 품질의 첫 번째 패스를 생성하여, 광범위한 초기 반복의 필요성을 줄여줍니다.
안전 및 배포
Grok 4.6의 안전 스택은 정당한 엔지니어링 및 연구 사용 사례에 대한 유용성을 극대화하도록 조정되었습니다. 여기에는 취약점 패치 및 엔지니어링 설계 주기 가속화와 같은 도메인에서 모델이 도움이 되도록 허용하는 것이 포함됩니다. xAI는 이러한 안전장치를 조정하기 위해 역대 가장 광범위한 배포 전 테스트 및 광범위한 제3자 테스트 세트를 사용했다고 보고했습니다.
가용성 및 가격
Grok 4.6은 SpaceXAI API, Grok Build 및 Cursor를 통해 사용할 수 있습니다. 또한 OpenRouter, Vercel, Cloudflare를 포함한 파트너를 통해서도 접속할 수 있습니다.
- 표준 가격: 입력 토큰 100만 개당 $2; 출력 토큰 100만 개당 $6.
- Fast Variant: 표준 가격의 두 배로 제공됩니다.
- 프로모션: Grok Build 및 Cursor 사용자는 출시 첫 주 동안 2배의 포함된 사용량을 받게 됩니다.
커뮤니티 통찰 및 반론
공식 벤치마크는 다른 프런티어 모델과 대등함을 보여주지만, Hacker News의 커뮤니티 피드백은 실제 경험에 대해 엇갈린 견해를 제시합니다:
성능 및 효율성
일부 사용자는 Grok 4.6이 경쟁사에 비해 더 간결하고 "핵심을 짚는다"고 보고하는 반면, 다른 이들은 GPT-5.6 Sol보다 토큰 효율성이 떨어진다고 주장합니다.
"[Grok 4.5]는 그냥 핵심을 짚고, 매우 빠르고 간결하며, 쓸데없는 말이 없습니다... 이상한 'Claude ipsum' 전문 용어도 없고... GPT 5.6-isms도 없습니다."
반대로, 일부 초기 도입자들은 모델이 이전 모델보다 느리고 복잡한 지침을 따르는 능력이 부족하다고 느꼈습니다:
"Cursor를 통해 몇 번 상호작용해 봤는데 첫 인상은 실망스럽다는 것입니다. 생성된 계획들이 중구난방이고 따라하기 어렵습니다... Grok 4.5가 더 나은 계획을 만들어냈습니다."
신뢰 및 거버넌스
xAI의 리더십과 관련된 신뢰 수준에 대해 상당한 논의가 있습니다. 일부 사용자는 데이터 프라이버시 및 기업 운영에 대한 Elon Musk의 개인적 관여에 대한 우려로 인해 다른 연구소를 선호한다고 밝혔습니다.
API 구현
기술 사용자들은 SpaceXAI API가 사용자 제공 시스템 지침보다 특정 안전 가이드라인(예: 익스플로잇이나 악성코드를 작성하는 것을 거부함)을 우선시하는 기본 시스템 프롬프트를 주입하는 것으로 보이며, 이로 인해 때때로 시스템 프롬프트 자체에 대한 논의를 거부하는 경우가 있다고 언급했습니다.
Sources
- HNGrok 4.6
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch