JevBench v1.3.0 基準將 Jev 1.13.0 評為首選決策模型,並突顯開源替代方案

JevBench v1.3.0 將 Jev 1.13.0 排名於 52 模型排行榜首位

結果: 官方 JevBench 分數(智慧、校準、速度與成本的幾何平均)將 Jev 1.13.0 排名為 74.4——所有測試系統中最高。次佳模型為 SemIf(73.1)與 djev(73.0),兩者皆為開源專案,僅在基準發布後數日內加入。


分數如何計算

軸向 定義 評分範圍
智慧 在簡單、標準、裁判與困難層級上的機會修正準確率(困難層級權重佔 30 %)。 0 = 隨機,100 = 完美
校準 難度層級機率題項:(a) 預期校準誤差與 (b) 與黃金分佈的總變異距離。 0 = 未校準,100 = 完美
速度 個別請求執行的中位數與第 95 百分位延遲(0.1 秒 = 100,每慢 10 倍損失 20 點)。自托管端點會調整 ×2 + 0.15 秒以近似生產負載。 0 = 慢,100 = 快
成本 每 1,000 次決策的美元(非每 token)。$0.001 = 100,每 10 倍高則損失 30 點。價格為供應商公開定價或根據規模類別參考率估算。 0 = 昂貴,100 = 免費

最終的 JevBench 分數 = (Intelligence × Calibration × Speed × Cost)^{1/4}。智慧 < 50 的系統額外處罰 ((I/50)^2)。


前十名排名系統(官方權重各 25 %)

排名 系統 分數 智慧 校準 速度 成本(美元/1k 決策)
1 Jev 1.13.0 (TypeSafe) 74.4 85.7 82.7 83.3 $0.040
2 SemIf (原 OpenJev, Qwen3.5‑4B) 73.1 79.0 72.6 83.7 ~$0.022
3 djev (Maisa, diffusion‑gemma) 73.0 82.7 65.4 91.4 $0.026
4 Winnow‑12B Q8 71.2 82.0 72.0 82.3 ~$0.037
5 reflex 4B 70.3 80.1 75.2 68.0 ~$0.022
6 jqv (Qwen‑32B zero‑shot) 68.6 79.3 79.0 74.6 ~$0.056
7 decision‑machine‑1 (milliseconds.ai) 68.3 62.1 70.4 92.9 $0.035
8 decider‑35b‑a3b (Mapika) 67.6 79.6 71.5 80.8 ~$0.067
9 open‑alternative‑jev (IkerMoel) 67.0 64.0 63.2 83.5 ~$0.022
10 system‑one‑open (Gemma 4 E2B LoRA) 66.6 69.5 56.7 77.0 ~$0.015

所有分數均基於未變動的 534 決策集(220 個難題)於 2026 年 9 月 21 日在德國伺服器測量。


開源 Jev 類模型超越許多商業產品

模型 基底模型 授權 JevBench 分數 顯著特徵
SemIf Qwen‑3.5‑4B MIT(程式碼) + Apache‑2.0(權重) 73.1 可在瀏覽器運行;除基底檢查點外無進一步微調。
djev DiffusionGemma‑26B‑A4B(Apache‑2.0) Apache‑2.0 73.0 提供一步推理路徑;實驗性「思考」模式較慢且成本更高。
Winnow‑12B Q8 Gemma‑12B(量化) Apache‑2.0 71.2 量化 GGUF,完整 GPU 運算卸載;私人訓練語料庫未釋出。
reflex 4B Qwen‑3.5‑4B + LoRA MIT 70.3 使用每原始資料校準檔案;狀態僅編碼一次,每個選項從標籤 logits 讀取。
jqv Qwen‑3‑32B(原廠) Apache‑2.0 68.6 零樣本;溫度在 MMLU 驗證集上擬合。

這些開源參賽者皆為 完全可重現——程式碼與權重公開可用,且基準工具(MIT 授權)可本地執行。


成本分析 – 為何價格在排名中至關重要

JevBench 報告的是 每 1,000 次決策的成本,而非每 token。Jev 1.13.0 平均每次決策約 950 個輸入 token,因此其 $0.040 成本對應 $0.042 / M 輸入 token(公開 TypeSafe 定價)。最便宜的入場是 classifier.dev(快速層級),每 1k 決策僅 $0.0033,但被列為 榮譽提及,因其僅包裝 Jev 1.13.0 而非獨立模型。

成本欄位對最終分數影響極大:若模型便宜 10 倍,成本軸可獲 30 點。例如,kev 0.6B 在成本軸得 76.1(最低階),但整體僅 62.5,因其智慧(51.9)與校準(51.1)偏低。


不同權重設定下的排名變化

基準提供四種預設權重。以下是每種觀點下的前三名(僅考慮達成 ≥95 % 決策覆蓋率的系統):

權重設定 #1 #2 #3
官方(各 25 %) Jev 1.13.0(74.4) SemIf(73.1) djev(73.0)
平衡(33 % 智慧,33 % 速度,33 % 成本) djev(75.8) Jev 1.13.0(71.8) SemIf(73.3)
強調準確率 Jev 1.13.0(77.1) djev(78.5) SemIf(75.5)
強調速度 djev(81.7) Jev 1.13.0(76.2) SemIf(77.3)
強調成本 kev 0.6B(70.4) Jev 1.13.0(63.1) SemIf(67.4)

這些表格顯示,以智慧為主 的權重設定有利於 Jev 1.13.0,而 以成本為主 的設定則使如 kev 0.6B 之類的低成本模型躍居榜首。


各主題領域的準確率(完整套件視角)

基準按主題拆解表現。Jev 1.13.0 在 日常語言(100 % 正確)與 安全與保安(100 %)方面最強。其最弱領域為 金融與商業(73 % 正確)。SemIf 在 程式設計與軟體(96 % 正確)表現出色,但在 規則、政策與法律(64 %)落後。djev 在前三大模型中擁有最高的 困難層級 公共準確率(67 % 正確)。

主題 Jev 1.13.0 SemIf djev
數學與數字 87.6 % 79.1 % 67.6 %
程式設計與軟體 83.9 % 96.4 % 71.3 %
規則、政策與法律 83.6 % 64.2 % 71.3 %
金融與商業 73.4 % 60.9 % 71.3 %
支援與運作 89.1 % 87.4 % 88.3 %
日常語言 100 % 100 % 100 %
安全與保安 100 % 75 % 95 %

榮譽提及 – 執行其他參賽者模型的服務

  • classifier.dev(快速層級) – 在獨立 API 下運行 Jev 1.13.0,得分 83.6(高於任何排名模型),但列為榮譽提及以避免重複計算同一基礎模型。
  • 其他服務(如 Qwen 3.8 27B 透過 Chutes、Needle 3 工具呼叫模式)被標示為 部分執行,因未回答 ≥95 % 的決策集。

為何某些模型未被測量

基準僅在模型無法於相同條件(硬體、授權或端點可用性)下評估時,才報告 部分執行 或 排除 狀態。範例:

  • open‑jev(MLX on Apple Silicon) – 無法在基準所用 NVIDIA GPU 上執行。
  • mini‑jev – 僅實現部分任務類型(Choice/Noul),缺乏 Score head。
  • Needle 3 – 回傳標籤與信心值,而非完整機率分佈,故僅列為部分執行。
  • 多個模型需專有授權(如 Gemma 在 Google 條款下)的授權,基準團隊無法代表作者接受。

社群反應(Hacker News)

  • @sean_pedersen 質疑重複結果與模型集差異。
  • @swyx 連結一討論,其中 Jev 首席执行官解釋為隱私考量而避免公開基準測試。
  • @hbrn 指控 Jev 是「詐騙」,因其表現與快速建立的 Qwen 基開源克隆(SemIf)相符,但成本約高出一倍。
  • @adityamishra241 問及基準如何防範過度擬合公開的 534 個問題;作者指出,評估期間保留一個 保留的困難層級(109 個項目)作為保密。
  • @tamimio 表示對基準發布後一周內出現約 80 個競爭模型感到驚訝。

如何提交新模型或自訂評估

  1. 在 JevBench 倉儲中開啟 issue(https://github.com/fstandhartinger/jevbench),提供可重現的端點 URL 或可執行的 Docker 映像。
  2. 提供精確的模型版本、授權,以及訓練期間是否使用任何公開的 JevBench 題目。
  3. 基準團隊將在完整的 534 決策套件上運行模型,並在下一版本公布結果。
  4. 若使用私有資料,基準提供 自訂評估 服務(https://benchmarkheaven.com/jev-models/custom-evaluation),可在您防火牆後運行您的模型。

重點摘要

  • Jev 1.13.0 在智慧、校準、速度與成本權重相等時,仍是最佳整體決策模型。
  • 開源重製版(SemIf、djev、Winnow‑12B Q8)具有高度競爭力,通常在速度或成本上超越商業 API,且分數僅略低於頂尖水平。
  • 成本至關重要:最便宜的模型獲得可觀分數,且在成本重視的權重設定下甚至可超越 Jev。
  • 透明度:基準公開完整工具、任務定義與每模型成本計算,促進可重現性與公平比較。
  • 社群監督嚴謹:多位留言者質疑基準價值、定價方法與過度擬合潛力,凸顯持續獨立評估的必要性。

快速參考表(前五名)

排名 系統 分數 成本(美元/1k 決策) 速度(p95)
1 Jev 1.13.0 74.4 $0.040 0.72 秒
2 SemIf 73.1 ~$0.022 0.78 秒
3 djev 73.0 $0.026 0.31 秒
4 Winnow‑12B Q8 71.2 ~$0.037 0.98 秒
5 reflex 4B 70.3 ~$0.022 3.75 秒

*所有數值均直接取自 JevBench v1.3.0 版本(2026 年 9 月 21 日),未經修改。

Sources

相關