JevBench v1.3.0 基准测试将 Jev 1.13.0 排名第一,并突出开源替代方案
JevBench v1.3.0 将 Jev 1.13.0 排在 52 个模型排行榜首位
结果: 官方 JevBench 得分(智能、校准、速度和成本的几何平均值)将 Jev 1.13.0 排名 74.4 —— 所有测试系统中最高。排名第二和第三的模型分别是 SemIf(73.1)和 djev(73.0),两者均为开源项目,仅在基准发布几天后便加入。
得分计算方式
| 轴 | 定义 | 评分范围 |
|---|---|---|
| 智能 | 在简单、标准、裁判和困难层级上的机会修正准确率(困难层级权重为 30 %)。 | 0 = 随机,100 = 完美 |
| 校准 | 针对困难层级概率题:(a) 期望校准误差 和 (b) 与黄金分布的总变差距离。 | 0 = 未校准,100 = 完美 |
| 速度 | 单次请求运行的中位数和第 95 百分位延迟(0.1 s = 100,每慢 10 倍扣 20 分)。自托管端点会调整 ×2 + 0.15 s 以近似生产负载。 | 0 = 慢,100 = 快 |
| 成本 | 每 1,000 次决策的美元价格(非按 token 计价)。$0.001 = 100,每 10 倍增加扣 30 分。价格要么来自提供商公开定价,要么基于大小类参考费率估算。 | 0 = 昂贵,100 = 免费 |
最终 JevBench 得分 = (Intelligence × Calibration × Speed × Cost)^{1/4}。智能得分 < 50 的系统将额外受到惩罚 ((I/50)^2)。
前十名系统(官方权重各 25 %)
| 排名 | 系统 | 得分 | 智能 | 校准 | 速度 | 成本(美元/1k 决策) |
|---|---|---|---|---|---|---|
| 1 | Jev 1.13.0 (TypeSafe) | 74.4 | 85.7 | 82.7 | 83.3 | $0.040 |
| 2 | SemIf (原 OpenJev,Qwen3.5‑4B) | 73.1 | 79.0 | 72.6 | 83.7 | ~$0.022 |
| 3 | djev (Maisa,diffusion‑gemma) | 73.0 | 82.7 | 65.4 | 91.4 | $0.026 |
| 4 | Winnow‑12B Q8 | 71.2 | 82.0 | 72.0 | 82.3 | ~$0.037 |
| 5 | reflex 4B | 70.3 | 80.1 | 75.2 | 68.0 | ~$0.022 |
| 6 | jqv (Qwen‑32B zero‑shot) | 68.6 | 79.3 | 79.0 | 74.6 | ~$0.056 |
| 7 | decision‑machine‑1 (milliseconds.ai) | 68.3 | 62.1 | 70.4 | 92.9 | $0.035 |
| 8 | decider‑35b‑a3b (Mapika) | 67.6 | 79.6 | 71.5 | 80.8 | ~$0.067 |
| 9 | open‑alternative‑jev (IkerMoel) | 67.0 | 64.0 | 63.2 | 83.5 | ~$0.022 |
| 10 | system‑one‑open (Gemma 4 E2B LoRA) | 66.6 | 69.5 | 56.7 | 77.0 | ~$0.015 |
所有得分均基于未更改的 534 项决策集(220 项困难题),于 2026 年 9 月 21 日在德国服务器上测量。
优于许多商业产品的开源 Jev 类模型
| 模型 | 基础模型 | 许可证 | JevBench 得分 | 显著特点 |
|---|---|---|---|---|
| SemIf | Qwen‑3.5‑4B | MIT(代码)+ Apache‑2.0(权重) | 73.1 | 可在浏览器中运行;除基础检查点外无微调。 |
| djev | DiffusionGemma‑26B‑A4B(Apache‑2.0) | Apache‑2.0 | 73.0 | 提供一步推理路径;实验性“思考”模式更慢且成本更高。 |
| Winnow‑12B Q8 | Gemma‑12B(量化) | Apache‑2.0 | 71.2 | 量化 GGUF,完全 GPU 加载;私有训练语料库未发布。 |
| reflex 4B | Qwen‑3.5‑4B + LoRA | MIT | 70.3 | 使用每个原始组件的校准文件;状态仅编码一次,每次选项从标签 logits 读取。 |
| jqv | Qwen‑3‑32B(原版) | Apache‑2.0 | 68.6 | 零样本;温度在 MMLU 验证集上拟合。 |
这些开源参赛者均为 完全可复现——代码和权重公开可用,基准测试工具链(MIT 许可)可在本地运行。
成本分析——为何价格在排名中至关重要
JevBench 报告的是 每 1,000 次决策的成本,而非每 token。Jev 1.13.0 平均每次决策约 950 个输入 token,因此其 $0.040 成本相当于 $0.042 / M 输入 token(公开的 TypeSafe 定价)。最便宜的入口是 classifier.dev(快速层级),为 $0.0033 每 1k 决策,但被列为 荣誉提名,因为它只是封装了 Jev 1.13.0 而非独立模型。
成本列对最终得分影响巨大:成本低 10 倍的模型在成本轴上获得 30 分。例如,kev 0.6B 在成本轴得分为 76.1(最低层级),但整体得分仅为 62.5,因为其智能(51.9)和校准(51.1)较低。
不同权重下的排名变化
该基准提供四种预设权重。以下是每种视角下的前三名(仅考虑满足 ≥95 % 决策覆盖率阈值的系统):
| 权重 | #1 | #2 | #3 |
|---|---|---|---|
| 官方(各 25 %) | Jev 1.13.0(74.4) | SemIf(73.1) | djev(73.0) |
| 均衡(33 % 智能,33 % 速度,33 % 成本) | djev(75.8) | Jev 1.13.0(71.8) | SemIf(73.3) |
| 强调准确性 | Jev 1.13.0(77.1) | djev(78.5) | SemIf(75.5) |
| 强调速度 | djev(81.7) | Jev 1.13.0(76.2) | SemIf(77.3) |
| 强调成本 | kev 0.6B(70.4) | Jev 1.13.0(63.1) | SemIf(67.4) |
这些表格说明,以智能为主的权重有利于 Jev 1.13.0,而以成本为主的权重则使像 kev 0.6B 这样的低成本模型跃居榜首。
各主题领域的准确率(完整套件视图)
该基准按主题分解性能。Jev 1.13.0 在 日常语言(100 % 正确)和 安全与安保(100 %)方面最强。其最弱领域是 金融与商务(73 % 正确)。SemIf 在 编程与软件(96 % 正确)方面表现优异,但在 规则、政策与法律(64 %)方面落后。djev 在前三个模型中展现出最高的 困难层级 公开准确率(67 % 正确)。
| 主题 | Jev 1.13.0 | SemIf | djev |
|---|---|---|---|
| 数学与数字 | 87.6 % | 79.1 % | 67.6 % |
| 编程与软件 | 83.9 % | 96.4 % | 71.3 % |
| 规则、政策与法律 | 83.6 % | 64.2 % | 71.3 % |
| 金融与商务 | 73.4 % | 60.9 % | 71.3 % |
| 支持与运营 | 89.1 % | 87.4 % | 88.3 % |
| 日常语言 | 100 % | 100 % | 100 % |
| 安全与安保 | 100 % | 75 % | 95 % |
荣誉提名——运行其他参赛者模型的服务
- classifier.dev(快速层级) – 在独立 API 下运行 Jev 1.13.0,得分为 83.6(高于任何排名模型),但列为荣誉提名以避免重复计算同一底层模型。
- 其他服务(如 Qwen 3.8 27B 通过 Chutes、Needle 3 工具调用模式)显示为 部分运行,因未回答 ≥95 % 的决策集。
为何某些模型未被测量
该基准仅在模型无法在相同条件下评估时报告 部分运行 或 排除 状态(硬件、许可或端点可用性)。示例:
- open‑jev(MLX on Apple Silicon) – 无法在基准所用的 NVIDIA GPU 上运行。
- mini‑jev – 仅实现部分任务类型(Choice/Noul),缺少 Score head。
- Needle 3 – 返回标签加置信度,而非完整的概率分布,因此仅列为部分运行。
- 多个模型需要专有许可证(如 Gemma 在 Google 条款下)——基准团队无法代表作者接受。
社区在 Hacker News 上的反应
- @sean_pedersen 质疑重复结果和模型集差异。
- @swyx 链接一个讨论,其中 Jev 首席执行官解释了出于隐私原因避免公开基准测试的决定。
- @hbrn 指控 Jev 是“骗局”,因其性能与快速构建的 Qwen 基础开源克隆(SemIf)相当,但价格约为两倍。
- @adityamishra241 询问基准如何防范对公开 534 个问题的过拟合;作者指出,在评估期间保持保密的 保留困难层级(109 项)作为验证集。
- @tamimio 对基准发布一周内迅速出现约 80 个竞争模型表示惊讶。
如何提交新模型或自定义评估
- 在 JevBench 仓库中打开一个问题(https://github.com/fstandhartinger/jevbench),提供可重现的端点 URL 或可运行的 Docker 镜像。
- 提供确切的模型版本、许可证,以及训练期间是否使用了任何公开的 JevBench 项目。
- 基准团队将在完整的 534 项决策套件上运行模型,并在下一个版本中公布结果。
- 对于私有数据,基准提供 自定义评估服务(https://benchmarkheaven.com/jev-models/custom-evaluation),可在您的防火墙后运行您的模型。
关键结论
- Jev 1.13.0 在智能、校准、速度和成本权重相等时,仍是最佳综合决策模型。
- 开源重建(SemIf、djev、Winnow‑12B Q8)极具竞争力,通常在速度或成本上超越商业 API,同时得分接近榜首。
- 成本至关重要:最便宜的模型也能取得合理得分,而在成本主导权重下甚至可超越 Jev。
- 透明性:基准公开完整工具链、任务定义和每模型成本计算,支持可复现性和公平比较。
- 社区监督严格——多位评论者质疑基准价值、定价方法及过拟合可能性,凸显持续独立评估的必要性。
快速参考表(前五名)
| 排名 | 系统 | 得分 | 成本(美元/1k 决策) | 速度(p95) |
|---|---|---|---|---|
| 1 | Jev 1.13.0 | 74.4 | $0.040 | 0.72 s |
| 2 | SemIf | 73.1 | ~$0.022 | 0.78 s |
| 3 | djev | 73.0 | $0.026 | 0.31 s |
| 4 | Winnow‑12B Q8 | 71.2 | ~$0.037 | 0.98 s |
| 5 | reflex 4B | 70.3 | ~$0.022 | 3.75 s |
所有数据均直接来自 JevBench v1.3.0 发布版(2026 年 9 月 21 日),未经修改。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch