Artificial Analysis Intelligence Index v4.2 發佈分析

新評估提升了真實、私密測試的標準

AA‑BriefcaseSurge’s GDP.pdf 是 Index v4.2 的主要新增項目。AA‑Briefcase 由產業專家構建,使用私密保留測試集、基於量規的評分與成對評分法,來評估為期數週、代理型知識工作專案,以衡量任務成功率、分析品質與呈現品質。由 Surge AI 創建的 GDP.pdf 則要求模型合成 4,592 頁 PDF(包含文字、表格、圖表、腳註)中的證據,並滿足 1,275 個原子標準;其核心指標是「全通過率」(All‑pass Rate),只有在滿足所有標準時,任務才會被視為正確。

私密保留測試權重翻倍以遏制刷榜行為

在整體 Index 權重中,私密保留測試數據的比例已從 v4.1 的 20% 提升至 v4.2 的 40%。保留測試集現在包括 AA‑Briefcase、AA‑Omniscience 以及 CritPt 的解決方案。此舉旨在減少模型開發者對公開基準測試的過度擬合(over-fit),並使 Index 更能反映真實世界的表現。團隊表示,即將推出的 v5 版本將進一步增加私密權重。

評分基礎設施升級提升分數穩定性

Version v4.2 在 AA‑LCR v1.1 中引入了新的評分系統提示詞(prompt),修復了答案鍵的歧義,並重新錨定(re-anchors)了 GDPval‑AA v2 與 AA‑Briefcase 的 Elo 分數。SciCode 的沙盒環境已進行強化,使得「慢但正確」的程式碼不再被判定為失敗。這些升級旨在隨著新模型的加入,使分數更趨於準確且波動較小。

排行榜亮點:Claude Fable 5.1 與 GPT‑6 Astra 領跑

  • Anthropic 的 Claude Fable 5.1 在整體 Index 中位居榜首。
  • OpenAI 的 GPT‑6 Astra 排名第二,並在「輸出 Token 效率」前沿(output‑token efficiency frontier)取得領先,與大多數競爭對手相比,其單位智慧分數的 Token 成本顯著較低。
  • Meta、SpaceXAI、Moonshot/Kimi、Z.AI 與 Google 隨後位列前六名。

任務成本 Pareto 前沿

四家實驗室——Anthropic、OpenAI、Meta 與 Z.AI——佔據了更新後的任務成本 Pareto 前沿,顯示其以最低的運算成本提供了最高的智慧分數。

Token 效率前沿

GPT‑6 Astra 是 Index 分數在 25 分以上模型中 Token 效率最高的模型,而 Claude Fable 5.1、Grok 4.5 與 Gemini 3.5 Flash‑Lite 則構成了曲線的兩端。

詳細基準測試表現

  • AA‑Briefcase: Claude Fable 5.1 與 Opus 5 領先,其次是 GPT‑6 Astra 與 Muse Spark 1.3。GPT‑6 Astra 較 GPT‑5.6 Sol 提升了約 85 Elo 分。
  • GDP.pdf: OpenAI 的 GPT‑6 Astra 達到了 33.2% 的全通過率(All‑pass Rate),領先於 GPT‑5.6 Sol (28.2%) 與 Claude Fable 5.1 (26.2%)。

Hacker News 社群反應

  • 對私密保留測試的正面看法:@jascha_eng 指出,衡量知識可靠性並懲罰幻覺的 Omniscience 指標,與真實世界的實用性強烈相關。他們強調 Fable 在此指標上優於 Opus 5,這與感知到的模型實力非常一致。
  • 對於事後調整的懷疑:@redox99 認為 Index 正在進行微調以使 Astra 的分數與預期相符,稱此舉「不科學」。
  • 對於基準測試相關性的批評:@throwaway13337 認為新基準測試集「沒用」,並質疑是否應包含 Gemini 3.8 等模型。
  • 對 Token 效率聲稱的讚賞:@jl 強調 Astra 在輸出 Token 前沿的領先地位,指出其在顯示的模型中擁有第二高的整體分數與第三低的 Token 使用量。
  • 對更廣泛基準測試覆蓋範圍的呼籲:@stared 與 @6thbit 詢問為何 ARC‑AGI‑3 缺席,並建議其加入後會改變排名。
  • 對權重變更的擔憂:@sanxiyn 與 @dgacmu 批評 SciCode 的權重增加,稱其為「壞掉的基準測試」,並主張使用更新的版本(例如 Terminal‑Bench 4.0)來更好地區分模型。

Artificial Analysis Index 的下一步是什麼?

團隊確認 v4.2 是為了加速即將到來的 v5 藍圖中的部分內容而進行的過渡版本。他們計劃在正式發佈 v5 之前進行額外的增量發佈,並將進一步增加私密測試權重,並引入更多複雜的真實世界任務。


請至 Artificial Analysis 網站閱讀完整的評估方法與詳細的各模型拆解分析。

Sources

相關