Opus 5가 Artificial Analysis Intelligence Leaderboard에서 1위를 차지하다

Opus 5가 Artificial Analysis Intelligence Leaderboard에서 1위를 차지하다

Opus 5가 Intelligence Leaderboard를 선도하다

Opus 5는 Artificial Analysis Intelligence Leaderboard에서 최상위 자리를 차지하고 있다. Hacker News 게시물에 따르면 Opus 5는 현재 리더보드에서 #1이다. @didibus의 댓글에서 선두 모델들을 나열했다: Claude Opus 5 (Adaptive Reasoning, Max Effort) 점수 61, Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 점수 60, Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) 점수 60, GPT‑5.6 Sol (max) 점수 59, Claude Opus 5 (Adaptive Reasoning, High Effort) 점수 59.

Intelligence Index가 측정하는 내용

Artificial Analysis Intelligence Index v4.1은 아홉 가지 특정 평가를 결합하여 단일 점수를 산출한다. 이 지수는 GDPval‑AA v2, 𝜏³‑Banking, Terminal‑Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA‑Omniscience, AA‑LCR을 포함한다. 표시에서 추론 모델은 전구 아이콘으로 표시된다. 방법론 페이지에서는 각 평가가 어떻게 실행되고 가중치가 부여되는지 설명한다.

비용과 성능 트레이드오프

Opus 5는 최고 수준의 지능을 제공하지만 높은 비용이 들며, 여러 저렴한 모델이 거의 동일한 점수를 제공한다. @chmod775은 Opus 5가 Fable 5 다음으로 두 번째로 비싼 모델이라고 언급하며, 최소 두 모델(GPT‑5.6과 Kimi K3)가 비용의 약 절반으로 점수를 1‑2% 차이 내에서 일치시킨다고 말했다. @nu11ptr는 GPT‑5.6 Sol Max가 Opus 5와 거의 동일한 성능을 약 절반의 비용으로 제공한다고 관찰했다. @zkmon은 달러당 지능이라는 더 유용한 지표가 필요하다고 제안했으며, @XCSme는 트레이드오프를 "twice the cost for 4% more intelligence"로 프레임했다.

신뢰성과 사용성에 대한 커뮤니티 반응

사용자들은 신뢰성 문제, UI 문제, occasional over‑engineering을 이유로 혼합된 경험을 보고했다. @andy99는 작은 점수 차이보다 신뢰성이 더 중요하다고 주장하며, Claude(Opus 5 포함)가 출력을 거부하거나 낮추는 안전 장치로 인해 손상되었다고 설명했다. @theplumber는 Opus 5가 Opus 4.8보다 "dumber" 혹은 "more superficial"하다고 느끼며, 세션 중에 길을 잃었다고 말했다. @hoppp는 코딩 스타일이 Fable와 다르다고 하며, 모델이 요청된 해결책을 과도하게 구축했다고 말했다. @zuzululu는 몇 시간 사용 후 Opus 5가 GPT‑5.6과 차이가 없다고 보고하며, UI가 놀랍게 나쁘다고 비판하고, Sol 5.6에 비해 깊이가 부족하다고 지적했다. @claude-ai는 Opus 5가 Opus 4.8(좋음)과 Fable(훌륭함)과 비교해 Haiku 수준처럼 느껴진다고 말하며, 권한 프롬프트에 혼란을 겪고 자신이 verurs한 실패한 테스트를 디버그할 수 없다고 밝혔다. 반면 Opus 4.8은 광범위한 "thinking" 없이 문제를 해결했다. @sggyamg은 단순히 모델을 "new, normal."이라고 불렀다.

기술 사양: 컨텍스트 윈도우, 속도, 지연, 모델 크기

Opus 5의 기술 프로파일에는 정의된 컨텍스트 윈도우, 토큰당 초 속도, 지연 측정치, 파라미터 수가 포함된다. 컨텍스트 윈도우 섹션에서는 입력 및 출력 토큰의 최대 합산 수를 보여주며, 값이 높을수록 검색 증강 워크플로우에 더 좋다. 출력 속도는 모델이 초당 생성하는 토큰 수를 측정하며, 높을수록 좋다. 지연(Time To First Answer Token)은 첫 번째 답변 토큰을 받는 데 걸리는 초를 보고하며, 추론 모델의 경우 "thinking" 시간도 포함된다. End‑to‑End Response Time은 입력 시간, 사고 시간(추론 모델의 경우), 출력 속도에 기반한 답변 시간을 결합하여 500토큰 응답을 출력하는 데 걸리는 초를 제공한다. 모델 크기(오픈‑웨이트 모델의 경우)는 훈련 가능한 총 파라미터와 추론 중에 실행되는 활성 파라미터를 구분한다; 밀집 모델에서는 활성이 총과 같으며, 전문가 혼합 모델은 전문가의 하위 집합으로 라우팅된다. 이 섹션 전반에 걸쳐 추론 모델은 전구 아이콘으로 표시된다.

개방성과 추론 지표

Openness Index는 모델의 개방성을 수치화하며, AA‑Omniscience Index는 지식 신뢰성과 환각을 측정한다. Openness Index는 0‑100 정규화된 척도로, 점수가 높을수록 개방성이 높음을 나타낸다. AA‑Omniscience Index(높을수록 좋음)는 정답에 보상을 주고, 환각에 페널티를 부과하며, 답변을 거부할 경우 페널티를 부과하지 않는다; 점수 범위는 ‑100에서 100이며, 0은 정답과 오답의 수가 같음을 의미한다. 두 지표 모두 추론 모델에 전구 아이콘을 적용한다.

Sources