JevBench v1.3.0 基准测试将 Jev 1.13.0 排名第一,并突出开源替代方案

JevBench v1.3.0 将 Jev 1.13.0 排在 52 个模型排行榜首位

结果: 官方 JevBench 得分(智能、校准、速度和成本的几何平均值)将 Jev 1.13.0 排名 74.4 —— 所有测试系统中最高。排名第二和第三的模型分别是 SemIf(73.1)和 djev(73.0),两者均为开源项目,仅在基准发布几天后便加入。


得分计算方式

轴 定义 评分范围
智能 在简单、标准、裁判和困难层级上的机会修正准确率(困难层级权重为 30 %)。 0 = 随机,100 = 完美
校准 针对困难层级概率题:(a) 期望校准误差 和 (b) 与黄金分布的总变差距离。 0 = 未校准,100 = 完美
速度 单次请求运行的中位数和第 95 百分位延迟(0.1 s = 100,每慢 10 倍扣 20 分)。自托管端点会调整 ×2 + 0.15 s 以近似生产负载。 0 = 慢,100 = 快
成本 每 1,000 次决策的美元价格(非按 token 计价)。$0.001 = 100,每 10 倍增加扣 30 分。价格要么来自提供商公开定价,要么基于大小类参考费率估算。 0 = 昂贵,100 = 免费

最终 JevBench 得分 = (Intelligence × Calibration × Speed × Cost)^{1/4}。智能得分 < 50 的系统将额外受到惩罚 ((I/50)^2)。


前十名系统(官方权重各 25 %)

排名 系统 得分 智能 校准 速度 成本(美元/1k 决策)
1 Jev 1.13.0 (TypeSafe) 74.4 85.7 82.7 83.3 $0.040
2 SemIf (原 OpenJev,Qwen3.5‑4B) 73.1 79.0 72.6 83.7 ~$0.022
3 djev (Maisa,diffusion‑gemma) 73.0 82.7 65.4 91.4 $0.026
4 Winnow‑12B Q8 71.2 82.0 72.0 82.3 ~$0.037
5 reflex 4B 70.3 80.1 75.2 68.0 ~$0.022
6 jqv (Qwen‑32B zero‑shot) 68.6 79.3 79.0 74.6 ~$0.056
7 decision‑machine‑1 (milliseconds.ai) 68.3 62.1 70.4 92.9 $0.035
8 decider‑35b‑a3b (Mapika) 67.6 79.6 71.5 80.8 ~$0.067
9 open‑alternative‑jev (IkerMoel) 67.0 64.0 63.2 83.5 ~$0.022
10 system‑one‑open (Gemma 4 E2B LoRA) 66.6 69.5 56.7 77.0 ~$0.015

所有得分均基于未更改的 534 项决策集(220 项困难题),于 2026 年 9 月 21 日在德国服务器上测量。


优于许多商业产品的开源 Jev 类模型

模型 基础模型 许可证 JevBench 得分 显著特点
SemIf Qwen‑3.5‑4B MIT(代码)+ Apache‑2.0(权重) 73.1 可在浏览器中运行;除基础检查点外无微调。
djev DiffusionGemma‑26B‑A4B(Apache‑2.0) Apache‑2.0 73.0 提供一步推理路径;实验性“思考”模式更慢且成本更高。
Winnow‑12B Q8 Gemma‑12B(量化) Apache‑2.0 71.2 量化 GGUF,完全 GPU 加载;私有训练语料库未发布。
reflex 4B Qwen‑3.5‑4B + LoRA MIT 70.3 使用每个原始组件的校准文件;状态仅编码一次,每次选项从标签 logits 读取。
jqv Qwen‑3‑32B(原版) Apache‑2.0 68.6 零样本;温度在 MMLU 验证集上拟合。

这些开源参赛者均为 完全可复现——代码和权重公开可用,基准测试工具链(MIT 许可)可在本地运行。


成本分析——为何价格在排名中至关重要

JevBench 报告的是 每 1,000 次决策的成本,而非每 token。Jev 1.13.0 平均每次决策约 950 个输入 token,因此其 $0.040 成本相当于 $0.042 / M 输入 token(公开的 TypeSafe 定价)。最便宜的入口是 classifier.dev(快速层级),为 $0.0033 每 1k 决策,但被列为 荣誉提名,因为它只是封装了 Jev 1.13.0 而非独立模型。

成本列对最终得分影响巨大:成本低 10 倍的模型在成本轴上获得 30 分。例如,kev 0.6B 在成本轴得分为 76.1(最低层级),但整体得分仅为 62.5,因为其智能(51.9)和校准(51.1)较低。


不同权重下的排名变化

该基准提供四种预设权重。以下是每种视角下的前三名(仅考虑满足 ≥95 % 决策覆盖率阈值的系统):

权重 #1 #2 #3
官方(各 25 %) Jev 1.13.0(74.4) SemIf(73.1) djev(73.0)
均衡(33 % 智能,33 % 速度,33 % 成本) djev(75.8) Jev 1.13.0(71.8) SemIf(73.3)
强调准确性 Jev 1.13.0(77.1) djev(78.5) SemIf(75.5)
强调速度 djev(81.7) Jev 1.13.0(76.2) SemIf(77.3)
强调成本 kev 0.6B(70.4) Jev 1.13.0(63.1) SemIf(67.4)

这些表格说明,以智能为主的权重有利于 Jev 1.13.0,而以成本为主的权重则使像 kev 0.6B 这样的低成本模型跃居榜首。


各主题领域的准确率(完整套件视图)

该基准按主题分解性能。Jev 1.13.0 在 日常语言(100 % 正确)和 安全与安保(100 %)方面最强。其最弱领域是 金融与商务(73 % 正确)。SemIf 在 编程与软件(96 % 正确)方面表现优异,但在 规则、政策与法律(64 %)方面落后。djev 在前三个模型中展现出最高的 困难层级 公开准确率(67 % 正确)。

主题 Jev 1.13.0 SemIf djev
数学与数字 87.6 % 79.1 % 67.6 %
编程与软件 83.9 % 96.4 % 71.3 %
规则、政策与法律 83.6 % 64.2 % 71.3 %
金融与商务 73.4 % 60.9 % 71.3 %
支持与运营 89.1 % 87.4 % 88.3 %
日常语言 100 % 100 % 100 %
安全与安保 100 % 75 % 95 %

荣誉提名——运行其他参赛者模型的服务

  • classifier.dev(快速层级) – 在独立 API 下运行 Jev 1.13.0,得分为 83.6(高于任何排名模型),但列为荣誉提名以避免重复计算同一底层模型。
  • 其他服务(如 Qwen 3.8 27B 通过 Chutes、Needle 3 工具调用模式)显示为 部分运行,因未回答 ≥95 % 的决策集。

为何某些模型未被测量

该基准仅在模型无法在相同条件下评估时报告 部分运行 或 排除 状态(硬件、许可或端点可用性)。示例:

  • open‑jev(MLX on Apple Silicon) – 无法在基准所用的 NVIDIA GPU 上运行。
  • mini‑jev – 仅实现部分任务类型(Choice/Noul),缺少 Score head。
  • Needle 3 – 返回标签加置信度,而非完整的概率分布,因此仅列为部分运行。
  • 多个模型需要专有许可证(如 Gemma 在 Google 条款下)——基准团队无法代表作者接受。

社区在 Hacker News 上的反应

  • @sean_pedersen 质疑重复结果和模型集差异。
  • @swyx 链接一个讨论,其中 Jev 首席执行官解释了出于隐私原因避免公开基准测试的决定。
  • @hbrn 指控 Jev 是“骗局”,因其性能与快速构建的 Qwen 基础开源克隆(SemIf)相当,但价格约为两倍。
  • @adityamishra241 询问基准如何防范对公开 534 个问题的过拟合;作者指出,在评估期间保持保密的 保留困难层级(109 项)作为验证集。
  • @tamimio 对基准发布一周内迅速出现约 80 个竞争模型表示惊讶。

如何提交新模型或自定义评估

  1. 在 JevBench 仓库中打开一个问题(https://github.com/fstandhartinger/jevbench),提供可重现的端点 URL 或可运行的 Docker 镜像。
  2. 提供确切的模型版本、许可证,以及训练期间是否使用了任何公开的 JevBench 项目。
  3. 基准团队将在完整的 534 项决策套件上运行模型,并在下一个版本中公布结果。
  4. 对于私有数据,基准提供 自定义评估服务(https://benchmarkheaven.com/jev-models/custom-evaluation),可在您的防火墙后运行您的模型。

关键结论

  • Jev 1.13.0 在智能、校准、速度和成本权重相等时,仍是最佳综合决策模型。
  • 开源重建(SemIf、djev、Winnow‑12B Q8)极具竞争力,通常在速度或成本上超越商业 API,同时得分接近榜首。
  • 成本至关重要:最便宜的模型也能取得合理得分,而在成本主导权重下甚至可超越 Jev。
  • 透明性:基准公开完整工具链、任务定义和每模型成本计算,支持可复现性和公平比较。
  • 社区监督严格——多位评论者质疑基准价值、定价方法及过拟合可能性,凸显持续独立评估的必要性。

快速参考表(前五名)

排名 系统 得分 成本(美元/1k 决策) 速度(p95)
1 Jev 1.13.0 74.4 $0.040 0.72 s
2 SemIf 73.1 ~$0.022 0.78 s
3 djev 73.0 $0.026 0.31 s
4 Winnow‑12B Q8 71.2 ~$0.037 0.98 s
5 reflex 4B 70.3 ~$0.022 3.75 s

所有数据均直接来自 JevBench v1.3.0 发布版(2026 年 9 月 21 日),未经修改。

Sources

相关