Artificial Analysis Intelligence Index v4.2 릴리스 분석

현실적이고 사적 테스트를 위한 평가 기준이 강화됨

AA‑BriefcaseSurge의 GDP.pdf는 Index v4.2의 주요 추가 평가 항목입니다. AA‑Briefcase는 산업 전문가들이 구축한 다주간에 걸친 에이전트 지식 작업 프로젝트를 평가하며, 사적 보류 테스트 세트, 평가 기준 기반 점수, 쌍별 평가를 통해 작업 성공률, 분석 품질, 발표 품질을 측정합니다. GDP.pdf는 Surge AI가 제작한 평가로, 4,592페이지의 PDF 문서(텍스트, 표, 차트, 각주 포함)에서 증거를 통합해야 하며, 1,275개의 원자적 기준을 충족해야 합니다. 주요 지표는 모든 기준 통과율으로, 모든 기준이 충족될 때에만 작업이 정확하다고 간주합니다.

사적 보류 평가 비중이 두 배로 증가하여 게임화 방지

Index 전체 가중치에서 사적 보류 테스트 데이터의 비중이 v4.1의 20 %에서 v4.2의 40 %로 증가했습니다. 보류 세트에는 AA‑Briefcase, AA‑Omniscience, CritPt의 해결책이 포함됩니다. 이 변화는 모델 개발자가 공개 벤치마크에 과도하게 최적화하는 것을 줄이고, 실제 세계 성능을 더 잘 반영하도록 하기 위한 것입니다. 팀은 향후 v5에서 사적 가중치가 더 증가할 것임을 시사했습니다.

평가 인프라 업그레이드로 점수 안정성 향상

v4.2 버전은 AA‑LCR v1.1에 새로운 평가 시스템 프롬프트를 도입하고, 정답 키의 모호성을 수정하며, GDPval‑AA v2와 AA‑Briefcase의 엘로 스케일을 재보정했습니다. SciCode의 사전 환경은 개선되어, 느리지만 정확한 코드가 더 이상 실패로 간주되지 않도록 했습니다. 이러한 업그레이드는 새로운 모델이 추가될 때 점수가 더 정확하고 변동성이 적도록 목표로 합니다.

랭킹 주요 포인트: Claude Fable 5.1과 GPT‑6 Astra가 독보적

  • Anthropic의 Claude Fable 5.1은 전체 Index에서 1위를 유지하고 있습니다.
  • OpenAI의 GPT‑6 Astra는 전체 순위 2위이며, 출력 토큰 효율성 전면에서 선도하고 있습니다. 대부분의 경쟁 모델보다 단위 지능당 토큰 비용이 훨씬 낮습니다.
  • Meta, SpaceXAI, Moonshot/Kimi, Z.AI, Google이 상위 6위를 차지했습니다.

작업당 비용 파레토 전면

Anthropic, OpenAI, Meta, Z.AI의 네 연구소가 업데이트된 작업당 비용 파레토 전면에 위치해 있으며, 이는 가장 낮은 컴퓨팅 비용으로 가장 높은 지능 점수를 제공함을 의미합니다.

토큰 효율성 전면

Index 점수 25 이상을 기록한 모델들 중에서 GPT‑6 Astra가 가장 토큰 효율성이 뛰어나며, Claude Fable 5.1, Grok 4.5, Gemini 3.5 Flash‑Lite가 곡선의 극단을 형성합니다.

상세 벤치마크 성능

  • AA‑Briefcase: Claude Fable 5.1과 Opus 5가 선두를 달리고 있으며, 그 뒤를 GPT‑6 Astra와 Muse Spark 1.3이 이어갑니다. GPT‑6 Astra는 GPT‑5.6 Sol보다 약 85 엘로 포인트 상승했습니다.
  • GDP.pdf: OpenAI의 GPT‑6 Astra는 33.2 %의 All‑pass Rate을 기록해 GPT‑5.6 Sol(28.2 %)과 Claude Fable 5.1(26.2 %)을 앞섰습니다.

Hacker News 커뮤니티 반응

  • 사적 보류 테스트에 긍정적 시각: @jascha_eng는 Omniscience 지수가 지식 신뢰성과 환각을 처벌하는 지표로, 실제 활용성과 강한 상관관계가 있다고 지적했습니다. Fable이 Opus 5보다 이 지표에서 뛰어나며, 모델의 실제 강도와 일치한다고 강조했습니다.
  • 후행 조정에 대한 회의적 시각: @redox99는 지수가 Astra의 점수를 기대에 맞추기 위해 조정되었다고 주장하며, 이 변화를 "비과학적"이라고 평가했습니다.
  • 벤치마크의 관련성에 대한 비판: @throwaway13337는 새로운 벤치마크 세트를 "유용하지 않다"고 평가하며, Gemini 3.8 같은 모델의 포함 여부를 의심했습니다.
  • 토큰 효율성 주장에 찬사: @__jl__는 Astra가 출력 토큰 전면에서 독보적임을 강조하며, 표시된 모델 중 두 번째로 높은 전체 점수와 세 번째로 낮은 토큰 사용량을 기록했다고 언급했습니다.
  • 더 넓은 벤치마크 커버리지 요청: @stared와 @6thbit는 ARC‑AGI‑3가 왜 빠져 있는지 묻고, 그 포함이 랭킹을 바꿀 수 있을 것이라고 제안했습니다.
  • 가중치 변화에 대한 우려: @sanxiyn과 @dgacmu는 SciCode의 가중치 증가에 대해 비판하며, 이를 "고장 난 벤치마크"라고 지칭하고, 더 새로운 버전(예: Terminal‑Bench 4.0)을 사용해 모델 간 차이를 더 잘 구분할 것을 주장했습니다.

Artificial Analysis Index의 다음 단계는?

팀은 v4.2가 향후 v5 로드맵의 일부를 가속화하는 중간 릴리스임을 확인했습니다. 전체 v5 출시 전에 추가적인 점진적 릴리스를 계획하고 있으며, 사적 테스트 가중치를 더 높이고, 더 정교한 현실 세계 작업을 도입할 예정입니다.


자세한 방법론과 모델별 분석은 Artificial Analysis 웹사이트에서 확인하세요.

Sources

관련