Artificial Analysis Intelligence Index v4.2 發佈分析
新評估提升了真實、私密測試的標準
AA‑Briefcase 與 Surge’s GDP.pdf 是 Index v4.2 的主要新增項目。AA‑Briefcase 由產業專家構建,使用私密保留測試集、基於量規的評分與成對評分法,來評估為期數週、代理型知識工作專案,以衡量任務成功率、分析品質與呈現品質。由 Surge AI 創建的 GDP.pdf 則要求模型合成 4,592 頁 PDF(包含文字、表格、圖表、腳註)中的證據,並滿足 1,275 個原子標準;其核心指標是「全通過率」(All‑pass Rate),只有在滿足所有標準時,任務才會被視為正確。
私密保留測試權重翻倍以遏制刷榜行為
在整體 Index 權重中,私密保留測試數據的比例已從 v4.1 的 20% 提升至 v4.2 的 40%。保留測試集現在包括 AA‑Briefcase、AA‑Omniscience 以及 CritPt 的解決方案。此舉旨在減少模型開發者對公開基準測試的過度擬合(over-fit),並使 Index 更能反映真實世界的表現。團隊表示,即將推出的 v5 版本將進一步增加私密權重。
評分基礎設施升級提升分數穩定性
Version v4.2 在 AA‑LCR v1.1 中引入了新的評分系統提示詞(prompt),修復了答案鍵的歧義,並重新錨定(re-anchors)了 GDPval‑AA v2 與 AA‑Briefcase 的 Elo 分數。SciCode 的沙盒環境已進行強化,使得「慢但正確」的程式碼不再被判定為失敗。這些升級旨在隨著新模型的加入,使分數更趨於準確且波動較小。
排行榜亮點:Claude Fable 5.1 與 GPT‑6 Astra 領跑
- Anthropic 的 Claude Fable 5.1 在整體 Index 中位居榜首。
- OpenAI 的 GPT‑6 Astra 排名第二,並在「輸出 Token 效率」前沿(output‑token efficiency frontier)取得領先,與大多數競爭對手相比,其單位智慧分數的 Token 成本顯著較低。
- Meta、SpaceXAI、Moonshot/Kimi、Z.AI 與 Google 隨後位列前六名。
任務成本 Pareto 前沿
四家實驗室——Anthropic、OpenAI、Meta 與 Z.AI——佔據了更新後的任務成本 Pareto 前沿,顯示其以最低的運算成本提供了最高的智慧分數。
Token 效率前沿
GPT‑6 Astra 是 Index 分數在 25 分以上模型中 Token 效率最高的模型,而 Claude Fable 5.1、Grok 4.5 與 Gemini 3.5 Flash‑Lite 則構成了曲線的兩端。
詳細基準測試表現
- AA‑Briefcase: Claude Fable 5.1 與 Opus 5 領先,其次是 GPT‑6 Astra 與 Muse Spark 1.3。GPT‑6 Astra 較 GPT‑5.6 Sol 提升了約 85 Elo 分。
- GDP.pdf: OpenAI 的 GPT‑6 Astra 達到了 33.2% 的全通過率(All‑pass Rate),領先於 GPT‑5.6 Sol (28.2%) 與 Claude Fable 5.1 (26.2%)。
Hacker News 社群反應
- 對私密保留測試的正面看法:@jascha_eng 指出,衡量知識可靠性並懲罰幻覺的 Omniscience 指標,與真實世界的實用性強烈相關。他們強調 Fable 在此指標上優於 Opus 5,這與感知到的模型實力非常一致。
- 對於事後調整的懷疑:@redox99 認為 Index 正在進行微調以使 Astra 的分數與預期相符,稱此舉「不科學」。
- 對於基準測試相關性的批評:@throwaway13337 認為新基準測試集「沒用」,並質疑是否應包含 Gemini 3.8 等模型。
- 對 Token 效率聲稱的讚賞:@jl 強調 Astra 在輸出 Token 前沿的領先地位,指出其在顯示的模型中擁有第二高的整體分數與第三低的 Token 使用量。
- 對更廣泛基準測試覆蓋範圍的呼籲:@stared 與 @6thbit 詢問為何 ARC‑AGI‑3 缺席,並建議其加入後會改變排名。
- 對權重變更的擔憂:@sanxiyn 與 @dgacmu 批評 SciCode 的權重增加,稱其為「壞掉的基準測試」,並主張使用更新的版本(例如 Terminal‑Bench 4.0)來更好地區分模型。
Artificial Analysis Index 的下一步是什麼?
團隊確認 v4.2 是為了加速即將到來的 v5 藍圖中的部分內容而進行的過渡版本。他們計劃在正式發佈 v5 之前進行額外的增量發佈,並將進一步增加私密測試權重,並引入更多複雜的真實世界任務。
請至 Artificial Analysis 網站閱讀完整的評估方法與詳細的各模型拆解分析。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch