xAI Grok 4.1 출시 노트

xAI는 향상된 감성 지능, 창의적 글쓰기 능력, 그리고 사실적 환각(hallucinations)의 감소를 통해 실세계 사용성을 개선한 Grok 4.1을 출시했습니다. 이 모델은 현재 grok.com 및 관련 iOS와 Android 애플리케이션의 모든 사용자에게 제공됩니다.

State-of-the-Art General Capability

Grok 4.1은 특히 LMArena Text Leaderboard에서 블라인드 인간 선호도 평가를 통해 새로운 벤치마크를 수립했습니다. 이 모델은 두 가지 주요 구성으로 제공됩니다:

  • Grok 4.1 Thinking (code name: quasarflux): 이 추론 모델은 1483 Elo로 전체 1위 자리를 차지하며, 가장 높은 비-xAI 모델을 31포인트 차이로 앞서고 있습니다.
  • Grok 4.1 Non-Reasoning (code name: tensor): 이 버전은 즉각적인 응답을 위해 사고 토큰(thinking tokens)을 사용하지 않으며, 1465 Elo로 전체 2위를 기록하고 있습니다. 특히, Grok 4.1의 비-사고 버전은 공개 리더보드에서 다른 모든 모델의 전체 추론 구성(full-reasoning configuration)을 능가합니다.

2025년 11월 1일부터 11월 14일까지 진행된 무음 출시(silent rollout) 기간 동안 실시된 블라인드 쌍체 비교 평가(blind pairwise evaluations)에서, Grok 4.1은 이전 프로덕션 모델 대비 64.78%의 확률로 선호되었습니다.

Technical Optimization and Methodology

xAI는 모델의 스타일, 개성, 유용성 및 정렬(alignment)을 최적화하기 위해 Grok 4를 구동했던 것과 동일한 대규모 강화 학습(RL) 인프라를 활용했습니다. 검증 불가능한 보상 신호(non-verifiable reward signals)를 처리하기 위해, xAI는 최첨단 에이전트 추론 모델(frontier agentic reasoning models)을 보상 모델로 사용하여 대규모로 응답을 자율적으로 평가하고 반복 개선하는 새로운 방법을 개발했습니다.

Emotional Intelligence and Creative Writing

Grok 4.1은 대인 관계 능력과 창의적 결과물을 측정하기 위해 EQ-Bench3 및 Creative Writing v3 벤치마크를 사용하여 평가되었습니다:

  • EQ-Bench3: 이 LLM 판정 테스트는 45가지 역할극 시나리오를 통해 능동적 감성 지능, 공감 능력 및 대인 관계 기술을 평가합니다. 평가는 기본 샘플링 파라미터와 Claude Sonnet 3.7을 지정된 판정 모델로 사용하여 수행되었습니다.
  • Creative Writing v3: 이 벤치마크는 루브릭(rubrics)과 모델 배틀 정규화 Elo를 모두 사용하여, 3회 반복에 걸쳐 32개의 서로 다른 글쓰기 프롬프트를 통한 성능을 측정합니다.

Reduction in Factual Hallucinations

xAI는 Grok 4.1의 사후 학습(post-training) 과정에서 정보 검색형 프롬프트에 대한 사실적 환각을 줄이는 데 집중했습니다. 이는 특히 검색 도구를 사용하지만 추론 깊이가 제한적일 수 있는 빠른 비-사고 모델을 대상으로 합니다.

평가는 프로덕션 트래픽의 실세계 정보 검색 쿼리와 FActScore 공개 벤치마크(전기 질문 500개)의 층화 표본(stratified sample)을 대상으로 수행되었습니다. 환각률은 모델 응답 내에서 주요 또는 경미한 오류가 있는 원자적 주장(atomic claims)의 비율에 대한 매크로 평균으로 정의됩니다. 이러한 평가는 웹 검색 도구가 장착된 비-사고 모델을 사용하여 수행되었습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch