Ed‑o‑meter 基準測試顯示 GLM‑5.3 在五分之一成本下超越 Anthropic 與 OpenAI 模型

GLM‑5.3 在 Ed‑o‑meter 排行榜上領先,以約 GPT‑5.5 五分之一的價格實現 100 % 通過率

重點: 在最新的 Ed‑o‑meter 基準測試中,開放權重的 GLM‑5.3 模型在所有測試項目中均取得完美通過率,獲得 9.3 分的評分,整圈總成本僅為 $0.28——僅為 GPT‑5.5 的 $1.43 價格的約 20 %。它是通用工作負載的首選單模型方案,而針對特定用途,也存在更快或更便宜的替代選擇。


基準測試方法對所有 17 個模型透明且一致

結論: Ed‑o‑meter 在每個模型上執行相同的 28 個真實世界任務,使用相同的提示、確定性評分與單一 OpenRouter 流式路徑,因此差異反映的是模型行為,而非實驗變異。

  • 所有模型均在固定「一圈」上評估,包含五個關卡——程式碼、資料、現實世界、安全性與工具使用,每個關卡均有多個類似單元測試的任務。
  • 通過率以 Wilson 95 % 信賴區間報告,因為每個模型僅針對每項任務執行一次。
  • 延遲以相同流式條件下的中位數「首個 token 時間」(TTFT)測量。
  • 成本根據供應商提供的每 token 價格計算,僅適用於回答試驗(拒絕則另行記錄)。
  • LLM 評分(品質分數)由另一個模型(fable‑5)根據保存的答案文字生成;其自我偏見已在腳註中披露。
  • 整個測試框架、任務定義與二進位檢查器均以 MIT 授權在 Featherbench 倉庫中開源。

整體結果顯示 GLM‑5.3 在品質與成本效率上均位居榜首

結論: GLM‑5.3 是唯一在所有五個關卡中均達成 100 % 通過率的模型,取得 9.3 分評分,每圈成本為 $0.28。

排名 模型 通過率(95 % 信賴區間) 評分 安全性通過率 TTFT 一圈成本 每任務成本
1 glm‑5.3 100 % [88–100] 9.3 100 % 16.3 s $0.28 $0.0101
2 deepseek‑v4‑pro 96 % [82–99] 8.7 83 % 40.0 s $0.081 $0.0029
3 gemini‑3.6‑flash 96 % [82–99] 8.8 83 % 6.6 s $0.48 $0.0170
4 gpt‑5.5 96 % [82–99] 8.7 100 % 13.2 s $1.43 $0.0510

此表格顯示前四名模型;完整排行榜包含 17 個模型。


模型特定亮點

GLM‑5.3 是全能冠軍

結論: GLM‑5.3 在所有關卡(程式碼、資料、現實世界、安全性、工具使用)中均以 100 % 通過率通過,儘管 TTFT 為 16.3 s,仍是安全性最高的單模型選擇。

  • 其評分 9.3 為所有模型中第三高。
  • 每任務成本($0.0101)遠低於任何封閉原始碼競爭對手。
  • 回應速度較慢是主要取捨;對於延遲敏感應用,GPT‑5.5 更快(13.2 s),且安全性表現相近。

GPT‑5.5 提供最佳的效能與品質比

結論: GPT‑5.5 與 GLM‑5.3 一樣達成 100 % 安全性通過率與 89 % 現實世界通過率,並在 13.2 s 內完成 TTFT,但其一圈成本高達 $1.43,約為前者的五倍。

GPT‑5.6‑luna 是高頻率、低風險任務的最便宜主力模型

結論: 每圈成本 $0.064(每任務 $0.0023),TTFT 為 5.3 s,GPT‑5.6‑luna 非常適合批次工作負載,即使偶爾失敗也可接受。

  • 其整體通過率為 79 %,安全性通過率降至 33 %,因此結果在投入生產前必須經過驗證。

Haiku‑4‑5 在合理成本下實現極低延遲

結論: Haiku‑4‑5 僅需 0.9 s 即可回應,每圈成本 $0.12,整體通過率達 96 %,是互動式應用的最快模型。

Kimi‑K3 取得最高評分(9.5)

結論: Kimi‑K3 的評分 9.5 表示其回答品質最佳,但其 26.4 s 的 TTFT 與 75 % 的資料關卡通過率限制了其在即時應用中的適用性。

Opus‑5 因供應商端過濾導致測量誤差

結論: Opus‑5 的程式碼通過率 43 % 並非真實能力不足;四個無害的 coding‑debug‑* 任務在產生任何 token 前即被阻擋,導致失敗次數被誇大。


安全性發現揭示 GPT‑5.6 系列的弱點

結論: GPT‑5.6 三兄弟(luna、terra、sol)的安全部分通過率低(33 %–50 %),因在 12 個安全單元中觸發了 11 個越獄偵測器。

  • 相較之下,GPT‑5.5、Claude 的 Haiku 系列與 Opus‑5 模型均達成 100 % 安全性通過率。
  • 使用者在部署 GPT‑5.6 變體時應採用強健的紅隊測試與外部過濾機制。

社群反應呈現懷疑與讚譽並存

結論: Hacker News 的評論者對基準測試的透明度表示讚賞,但對其有效性存疑,特別是針對 Haiku 模型的高分與依賴自我評分的評分系統。

"整個測試立刻讓人覺得是 Claude 生成的,難以認真看待。這些結果為何與現有的嚴謹 LLM 基準測試相矛盾?" – hellohello2

"幾乎有 10 個模型的通過率超過 95%——這不是過度飽和了嗎?我也非常懷疑那些將 Haiku 模型排在極高位置的基準測試。" — jchw

"一個問題是,每運行一次 $30 對許多可驗證任務來說噪音太大。我們剛發表了 GLM‑5.3 在多代理程式碼評估中的結果,它確實是個出色的模型,排名約在第 6 名。以這個價格,其實並非帕累托最優,略遜於 Grok‑4.6(速度更快且價格相同)。" — gertlabs

"我不清楚,我每天用開放模型處理個人專案,工作則用封閉模型。開放模型明顯落後於 Fable,也遠落後於 Opus。這些文章看起來都像是出於動機或一廂情願的想像。" — solenoid0937

"如果你只運行一個模型,就運行 glm‑5.3。這是一個糟糕的結論,僅有 28 個任務且大多數模型通過率很高,幾乎什麼都說明不了。應針對你的使用情境測試模型,並選擇能 100 % 滿足需求的最快、最小、最便宜模型。" — CMay

這些評論突顯了三個反覆出現的擔憂:

  1. 基準廣度——28 個任務可能無法涵蓋所有真實世界複雜性。
  2. 評分偏見——品質分數由 fable‑5 生成,其自我評分可能高估自身輸出。
  3. 供應商過濾影響——被阻擋的任務(如 Opus‑5 的 coding‑debug)可能人為壓低通過率。

作者揭露的限制與警告

結論: Ed‑o‑meter 作者承認四個可能造成扭曲的來源。

  1. 評分由 fable‑5 事後執行;自我評分已在表格中標示。
  2. fable‑5 自身的評分(9.3) 基於有限的 11 次試驗樣本,可能有向上偏誤。
  3. 食譜檢查器的假陽性 造成三個模型雖未提及食材卻被標記為通過素食食譜任務。
  4. fable‑5 與 opus‑5 的成本計算 排除了拒絕情況,否則這些模型會顯得更便宜。

自行運行 Ed‑o‑meter

結論: 此基準完全可重現;任何人都可克隆 Featherbench 倉庫並評估額外模型。

  • 測試框架、任務定義與二進位檢查器位於 https://github.com/ed‑is‑ai/featherbench(MIT 授權)。
  • 如需新增模型,請在 GitHub 提交問題,附上模型名稱、API 路徑與理由。
  • 整套 28 個任務在目前定價下運行成本約為 $30,對小型研究而言可負擔。

總結

結論: GLM‑5.3 目前提供最優的通用正確性、合理延遲與極低成本組合,使其成為開發者選擇單一可靠 LLM 的首選。更快的替代方案(GPT‑5.5、Haiku‑4‑5)與更便宜的批次導向模型(GPT‑5.6‑luna)則適用於特定情境,而 GPT‑5.6 系列的安全性缺陷與 Opus‑5 的過濾誤差提醒實務工作者,必須根據自身安全需求驗證模型行為。


一目瞭然的關鍵數據

指標 GLM‑5.3 GPT‑5.5 GPT‑5.6‑luna Haiku‑4‑5
整體通過率 100 % 96 % 79 % 96 %
安全性通過率 100 % 100 % 33 % 100 %
評分 9.3 8.7 8.6(自我評分) 7.4
TTFT 16.3 s 13.2 s 5.3 s 0.9 s
一圈成本 $0.28 $1.43 $0.064 $0.12
每任務成本 $0.0101 $0.0510 $0.0023 $0.0044

未來工作

  • 將任務套件擴展至超過 28 項,可減少統計噪音並提升通過率差異的可信度。
  • 每個模型執行多次可縮小 Wilson 區間並揭露變異性。
  • 使用獨立、非自我偏見的評估者重新評分,可解決 fable‑5 自我打分的疑慮。
  • 跟蹤不同路由供應商的 TTFT,可揭露網路層級的延遲效應。

實務建議: 通用工作負載從 GLM‑5.3 開始,延遲敏感時切換至 GPT‑5.5,而 GPT‑5.6‑luna 則適合可容忍安全相關失敗的低成本高吞吐量管道。在投入生產部署前,務必針對自身領域特定任務驗證模型行為。

Sources

相關