Opus 5 が Artificial Analysis Intelligence リーダーボードでトップ

Opus 5 が Artificial Analysis Intelligence リーダーボードでトップ

Opus 5 が Intelligence リーダーボードをリード

Opus 5 は Artificial Analysis Intelligence リーダーボードのトップに位置しています。Hacker News の投稿では、Opus 5 が現在リーダーボードで #1 であると述べられています。@didibus のコメントでは、トップモデルがリストされています:Claude Opus 5 (Adaptive Reasoning, Max Effort) が 61、Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) が 60、Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) が 60、GPT‑5.6 Sol (max) が 59、Claude Opus 5 (Adaptive Reasoning, High Effort) が 59 です。

Intelligence Index が測定するもの

Artificial Analysis Intelligence Index v4.1 は、9 つの特定の評価を組み合わせて単一のスコアを出します。 このインデックスは、GDPval‑AA v2、𝜏³‑Banking、Terminal‑Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA‑Omniscience、および AA‑LCR を組み込みます。推論モデルは表示時にライトバルブアイコンでマークされます。方法論ページでは、各評価の実行方法と重み付けが説明されています。

コストとパフォーマンスのトレードオフ

Opus 5 は最高のインテリジェンスを提供しますが、コストが高く、いくつかの安価なモデルがほぼ同じスコアを提供しています。 @chmod775 は、Opus 5 が Fable 5 に次いで 2 番目に高価なモデルであり、少なくとも 2 つのモデル(GPT‑5.6 と Kimi K3)がそのスコアを 1‑2% の範囲で匹敵し、コストは約半分であると指摘しています。@nu11ptr は、GPT‑5.6 Sol Max がほぼ同じパフォーマンスを Opus 5 とほぼ同じで、コストは約半分であると観察しています。@zkmon は、より有用な指標はドルあたりのインテリジェンスであると提案し、@XCSme はトレードオフを "twice the cost for 4% more intelligence)" と表現しています。

信頼性と使いやすさに関するコミュニティの反応

ユーザーは混合した経験を報告しており、信頼性の懸念、UI の問題、および時折の過剰設計を挙げています。 @andy99 は、わずかなスコア差よりも信頼性が重要だと主張し、Claude(Opus 5 を含む)は出力を拒否または劣化させるセーフガードによって損なわれていると述べています。@theplumber は、Opus 5 が Opus 4.8 よりも "dumber" または "more superficial" だと感じ、セッションで迷子になったと述べています。@hoppp は、コーディングスタイルが Fable と異なり、モデルが要求されたソリューションを過剰に構築したと述べています。@zuzululu は、数時間使用した後、Opus 5 は GPT‑5.6 と変わらず、UI が驚くほど悪いと批判し、Sol 5.6 と比較して深みに欠けると指摘しています。@claude-ai は、Opus 5 が Opus 4.8 (良い)および Fable ( superb )と比べて Haiku レベルのように感じられ、権限プロンプトで混乱し、自分が原因で失敗したテストをデバッグできないと述べています。一方、Opus 4.8 は広範な "thinking)" なしで問題を解決しました。@sggyamg は単純にモデルを "new, normal." と呼んでいます。

技術仕様:コンテキストウィンドウ、速度、レイテンシ、モデルサイズ

Opus 5 の技術プロファイルには、定義されたコンテキストウィンドウ、トークン毎秒速度、レイテンシメトリクス、およびパラメータ数が含まれます。 コンテキストウィンドウのセクションでは、結合された入力および出力トークンの最大数を表示します;値が大きいほど、検索拡張ワークフローに適しています。出力速度は、モデルが生成するトークン毎秒を測定します;大きいほど良いです。レイテンシ(Time To First Answer Token)は、最初の回答トークンを受信するまでの秒数を報告し、推論モデルの場合は任意の "thinking" 時間も含みます。エンドツーエンド応答時間は、入力時間、思考時間(推論モデルの場合)、および出力速度に基づく回答時間を組み合わせて、500 トークンの出力にかかる秒数を示します。モデルサイズ(オープンウェイトモデルの場合)は、推論中に実行されるアクティブなパラメータから総訓練可能パラメータを区別します;密なモデルではアクティブは総数と等しく、混合エキスパートモデルではエキスパートのサブセットにルーティングされます。推論モデルはこれらのセクション全体でライトバルブアイコンで示されます。

オープンネスと推論インディケータ

オープンネス指数はモデルのオープンネスを定量化し、AA‑Omniscience 指数は知識の信頼性と幻覚を測定します。 オープンネス指数は 0‑100 の正規化スケールで、スコアが高いほどオープンネスが高いことを示します。AA‑Omniscience 指数(高いほど良い)は正解に報酬を与え、幻覚にペナルティを課し、回答を拒否した場合にはペナルティを課しません;スコア範囲は ‑100 から 100 で、0 は正解と不正解の数が等しいことを意味します。両方の指標は、推論モデルにライトバルブアイコンを適用します。

Sources