Ed‑o‑meter 基准测试显示 GLM‑5.3 以五分之一的成本超越 Anthropic 和 OpenAI 模型

GLM‑5.3 在 Ed‑o‑meter 排行榜上占据主导地位,以约 GPT‑5.5 五分之一的成本实现 100 % 的通过率

核心要点: 在最新的 Ed‑o‑meter 基准测试中,开源权重的 GLM‑5.3 模型在所有测试环节均取得完美通过率,获得 9.3 分的评分,单次完整测试成本仅为 0.28 美元——约为 GPT‑5.5 的 1.43 美元价格的 20 %。它是通用工作负载的推荐单一模型选择,而针对特定用例,也存在更快或更便宜的替代方案。


基准测试方法对所有 17 个模型保持透明且统一

结论: Ed‑o‑meter 对每个模型运行相同的 28 项真实世界任务,使用完全一致的提示、确定性评分和单一 OpenRouter 流式路径,因此差异反映的是模型行为本身,而非实验变异性。

  • 所有模型均在固定“赛道”上进行评估,包含五个环节——编码、数据、现实世界、安全性和工具使用,每个环节均包含多个类似单元测试的任务。
  • 通过率以 Wilson 95 % 置信区间报告,因为每个模型在每项任务中仅运行一次。
  • 延迟以相同流式条件下中位数的首次标记时间(TTFT)衡量。
  • 成本根据供应商提供的每标记费率计算,仅应用于回答试验(拒绝项单独记录)。
  • LLM 评分(质量分)由另一个模型(fable‑5)基于保存的答案文本生成;其自我偏见已在脚注中披露。
  • 整个测试框架、任务定义和二进制检查器均在 MIT 许可的 Featherbench 仓库中开源。

总体结果表明 GLM‑5.3 在质量和成本效率上均位居榜首

结论: GLM‑5.3 是唯一在所有五个环节均实现 100 % 通过率的模型,获得 9.3 分的评分,单次完整测试成本为 0.28 美元。

排名 模型 通过率(95 % 置信区间) 评分 安全通过 TTFT 单次成本 每任务成本
1 glm‑5.3 100 % [88–100] 9.3 100 % 16.3 s $0.28 $0.0101
2 deepseek‑v4‑pro 96 % [82–99] 8.7 83 % 40.0 s $0.081 $0.0029
3 gemini‑3.6‑flash 96 % [82–99] 8.8 83 % 6.6 s $0.48 $0.0170
4 gpt‑5.5 96 % [82–99] 8.7 100 % 13.2 s $1.43 $0.0510

该表格展示前四名模型;完整排行榜包含 17 个模型。


模型特异性亮点

GLM‑5.3 是全能冠军

结论: GLM‑5.3 在所有环节(编码、数据、现实世界、安全性、工具使用)均实现 100 % 通过率,尽管首次标记时间(TTFT)为 16.3 s,仍是最安全的单一模型选择。

  • 其 9.3 分的评分在所有模型中位列第三。
  • 每任务成本(0.0101 美元)远低于任何闭源竞争对手。
  • 响应速度较慢是主要权衡;对于延迟敏感的应用,GPT‑5.5 更快(13.2 s),且安全性表现相当。

GPT‑5.5 提供最佳速度与质量比

结论: GPT‑5.5 在保持 100 % 安全通过率和 89 % 现实世界通过率的同时,实现 13.2 s 的 TTFT,但其单次测试成本高达 1.43 美元,约为 GLM‑5.3 的五倍。

GPT‑5.6‑luna 是高吞吐、低风险任务的最廉价主力

结论: 以每轮 0.064 美元(每任务 0.0023 美元)和 5.3 s 的 TTFT,GPT‑5.6‑luna 非常适合批量任务,即使偶尔失败也可接受。

  • 其整体通过率为 79 %,安全性通过率降至 33 %,因此在投入生产前必须进行验证。

Haiku‑4‑5 在成本适中情况下实现超低延迟

结论: Haiku‑4‑5 仅需 0.9 s 即可响应,每轮成本 0.12 美元,整体通过率 96 %,是交互式应用场景的最快模型。

Kimi‑K3 达到最高评分(9.5)

结论: Kimi‑K3 的 9.5 分评分表明其答案质量最佳,但 26.4 s 的 TTFT 和 75 % 的数据环节通过率限制了其在实时应用中的适用性。

Opus‑5 的结果受供应商端过滤影响,存在测量偏差

结论: Opus‑5 的编码通过率仅为 43 % 并非真实能力不足;在生成任何标记前,四个无害的 coding‑debug‑* 任务已被拦截,导致失败计数被人为夸大。


安全性发现揭示 GPT‑5.6 系列的弱点

结论: GPT‑5.6 三兄弟(luna、terra、sol)表现出较低的安全通过率(33 %–50 %),因为在 12 个安全单元中有 11 个触发了越狱检测器。

  • 相比之下,GPT‑5.5、Claude 的 Haiku 系列以及 Opus‑5 模型均实现 100 % 安全通过率。
  • 在部署 GPT‑5.6 变体时,应使用强大的红队测试和外部过滤机制。

社区反应呈现质疑与赞誉并存

结论: Hacker News 用户对基准测试的透明度表示赞赏,但对其有效性存疑,尤其对 Haiku 模型的高分和依赖自我评分的评分体系表示怀疑。

"整个事情读起来立刻就像 Claude 生成的,让人难以认真对待。为什么这些结果与现有严肃的 LLM 基准测试相矛盾?" – hellohello2

"几乎 10 个模型的通过率都超过 95%——这难道不是严重过度饱和了吗?我对任何将 Haiku 模型排在非常高的基准测试也持强烈怀疑态度。" — jchw

"一个问题是,每次运行 30 美元对许多可验证任务来说噪声太大。我们刚刚在多智能体编码评估中发布了 GLM‑5.3 的结果,它确实是一个令人印象深刻的表现,排名约第 6。就价格而言,它实际上并非帕累托最优,略逊于 Grok‑4.6(速度更快且价格相同)。" — gertlabs

"我不确定,我每天在个人项目中使用开源模型,工作中使用闭源模型。开源模型明显落后于 Fable,也落后于 Opus 一大截。这些帖子在我看来都像是有动机或一厢情愿的想法。" — solenoid0937

"如果你只运行一个模型,就运行 glm‑5.3。这根本不是个好建议,只有 28 个任务,且大多数模型通过率都很高,几乎什么信息都没说明。针对你的用例测试模型,并选择最快、最小、最便宜且 100 % 满足你需求的模型。" — CMay

这些评论突显了三个反复出现的担忧:

  1. 基准测试广度——28 个任务可能无法涵盖所有现实世界的复杂性。
  2. 评分体系偏见——质量评分由 fable‑5 生成,其自我评分可能导致高估自身输出。
  3. 供应商过滤影响——被拦截的任务(如 Opus‑5 的 coding‑debug)可能人为压低通过率。

作者披露的局限性与注意事项

结论: Ed‑o‑meter 作者承认存在四个潜在偏差来源。

  1. 评分由 fable‑5 事后完成;自我评分已在表格中标记。
  2. fable‑5 自身的评分(9.3) 基于有限的 11 次试验样本,可能存在向上偏倚。
  3. 配方检查器误报 导致三个模型在未提及食材的情况下仍被标记为通过素食配方任务。
  4. fable‑5 和 opus‑5 的成本计算 未包含拒绝项,否则这些模型会显得更便宜。

自行运行 Ed‑o‑meter

结论: 该基准测试完全可复现;任何人都可克隆 Featherbench 仓库并评估其他模型。

  • 测试框架、任务定义和二进制检查器可在 https://github.com/ed‑is‑ai/featherbench(MIT 许可)获取。
  • 如需添加新模型,请在 GitHub 上提交问题,注明模型名称、API 路由和理由。
  • 当前价格体系下,完整 28 任务套件运行成本约为 30 美元,对小规模研究而言负担合理。

总结

结论: GLM‑5.3 目前提供了通用正确性、合理延迟和超低成本的最佳组合,使其成为开发者在需要单一可靠 LLM 时的默认选择。更快的替代方案(GPT‑5.5、Haiku‑4‑5)和更便宜的批量模型(GPT‑5.6‑luna)填补了特定角色,而 GPT‑5.6 系列的安全缺陷以及 Opus‑5 受过滤影响的特性提醒从业者,必须根据自身安全要求验证模型行为。


关键数据一览

指标 GLM‑5.3 GPT‑5.5 GPT‑5.6‑luna Haiku‑4‑5
整体通过率 100 % 96 % 79 % 96 %
安全通过率 100 % 100 % 33 % 100 %
评分 9.3 8.7 8.6(自我评分) 7.4
TTFT 16.3 s 13.2 s 5.3 s 0.9 s
单次成本 $0.28 $1.43 $0.064 $0.12
每任务成本 $0.0101 $0.0510 $0.0023 $0.0044

未来工作

  • 扩展任务套件至 28 项以上,可减少统计噪声并提高通过率差异的置信度。
  • 为每个模型引入多次运行,可收紧 Wilson 区间并揭示变异性。
  • 使用独立、无自我偏见的评估者重新评分,可解决 fable‑5 自我评分的担忧。
  • 跟踪不同路由提供商的 TTFT,可揭示网络层面的延迟影响。

对实践者的建议: 通用工作负载首选 GLM‑5.3;延迟敏感场景切换至 GPT‑5.5;GPT‑5.6‑luna 适合可容忍安全相关失败的低成本高吞吐流水线。在投入生产部署前,务必针对自身领域特定任务验证模型表现。

Sources

相关