Artificial Analysis Intelligence Index v4.2 リリース分析

新しい評価指標が、現実的でプライベートなテストの基準を引き上げる

AA‑BriefcaseSurge’s GDP.pdf が Index v4.2 の主要な追加要素です。AA‑Briefcase は、業界の専門家によって構築された数週間にわたるエージェント的な知識作業プロジェクトを、非公開のホールドアウト・テストセット、ルーブリックに基づいたスコアリング、およびペアワイズ・グレーディングを使用して評価し、タスクの成功、分析の質、およびプレゼンテーションの質を測定します。GDP.pdf は、Surge AI によって作成され、モデルに 4,592 ページの PDF(テキスト、表、チャート、脚注)にわたる証拠を統合することを要求し、1,275 個の原子的な基準を満たすことを求めます。主要な指標は All‑pass Rate で、すべての基準が満たされた場合にのみタスクが正解としてカウントされます。

ゲーム化を防ぐため、非公開ホールドアウトの重み付けを倍増させる

Index 全体の重み付けにおける非公開ホールドアウト・テストデータの割合は、v4.1 の 20% から v4.2 の 40% に上昇しました。ホールドアウト・セットには、現在 AA‑Briefcase、AA‑Omniscience、および CritPt のソリューションが含まれています。この変更は、モデル開発者が公開ベンチマークに過学習(オーバーフィット)する能力を低減し、Index をより現実世界の性能を反映するものにすることを目的としています。チームは、次回の v5 では非公開の重み付けがさらに増加することを示唆しています。

スコアの安定性を向上させるための採点インフラのアップグレード

バージョン v4.2 は、AA-LCR v1.1 における新しい採点システム・プロンプトを導入し、解答キーの曖昧さを修正し、GDPval-AA v2 および AA-Briefcase の Elo スケールを再アンカーします。SciCode のサンドボックスは強化され、低速だが正しいコードが失敗として記録されないようになります。これらのアップグレードは、新しいモデルが追加されるにつれて、スコアをより正確かつ変動が少なくなるようにすることを目的としています。

リーダーボードのハイライト: Claude Fable 5.1 と GPT‑6 Astra が支配する

  • Anthropic の Claude Fable 5.1 は、Index 全体のトップの座を維持しています。
  • OpenAI の GPT‑6 Astra は、全体で 2 位にランクされ、output‑token 効率 のフロンティアをリードしており、ほとんどの競合他社と比較して、知能の単位あたりのトークンコストが大幅に低くなっています。
  • Meta、SpaceXAI、Moonshot/Kimi、Z.AI、および Google がトップ 6 を占めています。

コスト・パー・タスク Pareto 境界線

Anthropic, OpenAI, Meta, および Z.AI の 4 つのラボが、更新されたコスト・パー・タスク Pareto 境界線上に位置しており、これらが最も低い計算コストで最も高い知能スコアを提供していることを示しています。

トークン効率のフロンティア

GPT-6 Astra は、Index 上で 25 を超えるスコアを獲得したモデルの中で最もトークン効率が高いモデルであり、Claude Fable 5.1、Grok 4.5、および Gemini 3.5 Flash-Lite が曲線の両端を形成しています。

詳細なベンチマーク・パフォーマンス

  • AA‑Briefcase: Claude Fable 5.1 と Opus 5 がリードし、GPT-6 Astra が GPT-5.6 Sol に次いで続きます。GPT-6 Astra は GPT-5.6 Sol に対して約 85 Elo ポイントの獲得を実現しました。
  • GDP.pdf: OpenAI の GPT-6 Astra は 33.2% の All-pass Rate を達成し、GPT-5.6 Sol (28.2%) と Claude Fable 5.1 (26.2%) を上回りました。

Hacker News でのコミュニティの反応

  • 非公開ホールドアウト・テストへの肯定的な見解: @jascha_eng は、知識の信頼性を測定し、ハルシネーションを罰する Omniscience インデックスが、現実世界の有用性としなやかに相関していると述べています。彼らは、Fable がこの指標において Opus 5 を上回っていることを指摘し、それが知覚されるモデルの強みと一致していることを強調しています。
  • 懐疑的な見方による事後調整: @redox99 は、インデックスが Astra のスコアを期待値に合わせるために調整されたと主張し、その変更を「科学的ではない」と呼んでいます。
  • ベンチマークの関連性に対する批判: @throwaway13337 は、新しいベンチマーク・セットを「役に立たない」として退け、Gemini 3.8 のようなモデルの inclusion を疑問視しています。
  • トークン効率の主張への称賛: @jl は、Astra の output-token フロンティアにおける支配的な地位を強調し、表示されたモデルの中で 2 番目に高い総合スコアと 3 番目に低いトークン使用量であることを指摘しています。

Artificial Analysis Index の次なる展開は?

チームは、v4.2 は、次回の v5 ロードマップの一部を加速させるための暫定的なリリースであると確認しています。彼らは、完全な v5 のリリースに向けて、非公開テストの重み付けをさらに増やし、より洗練された現実世界のタスクを評価するための、追加の段階的なリリースを予定しています。


詳細な手法とモデルごとの詳細な内訳は、Artificial Analysis のウェブサイトでご覧いただけます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch