JevBench v1.3.0 基準將 Jev 1.13.0 評為首選決策模型,並突顯開源替代方案
JevBench v1.3.0 將 Jev 1.13.0 排名於 52 模型排行榜首位
結果: 官方 JevBench 分數(智慧、校準、速度與成本的幾何平均)將 Jev 1.13.0 排名為 74.4——所有測試系統中最高。次佳模型為 SemIf(73.1)與 djev(73.0),兩者皆為開源專案,僅在基準發布後數日內加入。
分數如何計算
| 軸向 | 定義 | 評分範圍 |
|---|---|---|
| 智慧 | 在簡單、標準、裁判與困難層級上的機會修正準確率(困難層級權重佔 30 %)。 | 0 = 隨機,100 = 完美 |
| 校準 | 難度層級機率題項:(a) 預期校準誤差與 (b) 與黃金分佈的總變異距離。 | 0 = 未校準,100 = 完美 |
| 速度 | 個別請求執行的中位數與第 95 百分位延遲(0.1 秒 = 100,每慢 10 倍損失 20 點)。自托管端點會調整 ×2 + 0.15 秒以近似生產負載。 | 0 = 慢,100 = 快 |
| 成本 | 每 1,000 次決策的美元(非每 token)。$0.001 = 100,每 10 倍高則損失 30 點。價格為供應商公開定價或根據規模類別參考率估算。 | 0 = 昂貴,100 = 免費 |
最終的 JevBench 分數 = (Intelligence × Calibration × Speed × Cost)^{1/4}。智慧 < 50 的系統額外處罰 ((I/50)^2)。
前十名排名系統(官方權重各 25 %)
| 排名 | 系統 | 分數 | 智慧 | 校準 | 速度 | 成本(美元/1k 決策) |
|---|---|---|---|---|---|---|
| 1 | Jev 1.13.0 (TypeSafe) | 74.4 | 85.7 | 82.7 | 83.3 | $0.040 |
| 2 | SemIf (原 OpenJev, Qwen3.5‑4B) | 73.1 | 79.0 | 72.6 | 83.7 | ~$0.022 |
| 3 | djev (Maisa, diffusion‑gemma) | 73.0 | 82.7 | 65.4 | 91.4 | $0.026 |
| 4 | Winnow‑12B Q8 | 71.2 | 82.0 | 72.0 | 82.3 | ~$0.037 |
| 5 | reflex 4B | 70.3 | 80.1 | 75.2 | 68.0 | ~$0.022 |
| 6 | jqv (Qwen‑32B zero‑shot) | 68.6 | 79.3 | 79.0 | 74.6 | ~$0.056 |
| 7 | decision‑machine‑1 (milliseconds.ai) | 68.3 | 62.1 | 70.4 | 92.9 | $0.035 |
| 8 | decider‑35b‑a3b (Mapika) | 67.6 | 79.6 | 71.5 | 80.8 | ~$0.067 |
| 9 | open‑alternative‑jev (IkerMoel) | 67.0 | 64.0 | 63.2 | 83.5 | ~$0.022 |
| 10 | system‑one‑open (Gemma 4 E2B LoRA) | 66.6 | 69.5 | 56.7 | 77.0 | ~$0.015 |
所有分數均基於未變動的 534 決策集(220 個難題)於 2026 年 9 月 21 日在德國伺服器測量。
開源 Jev 類模型超越許多商業產品
| 模型 | 基底模型 | 授權 | JevBench 分數 | 顯著特徵 |
|---|---|---|---|---|
| SemIf | Qwen‑3.5‑4B | MIT(程式碼) + Apache‑2.0(權重) | 73.1 | 可在瀏覽器運行;除基底檢查點外無進一步微調。 |
| djev | DiffusionGemma‑26B‑A4B(Apache‑2.0) | Apache‑2.0 | 73.0 | 提供一步推理路徑;實驗性「思考」模式較慢且成本更高。 |
| Winnow‑12B Q8 | Gemma‑12B(量化) | Apache‑2.0 | 71.2 | 量化 GGUF,完整 GPU 運算卸載;私人訓練語料庫未釋出。 |
| reflex 4B | Qwen‑3.5‑4B + LoRA | MIT | 70.3 | 使用每原始資料校準檔案;狀態僅編碼一次,每個選項從標籤 logits 讀取。 |
| jqv | Qwen‑3‑32B(原廠) | Apache‑2.0 | 68.6 | 零樣本;溫度在 MMLU 驗證集上擬合。 |
這些開源參賽者皆為 完全可重現——程式碼與權重公開可用,且基準工具(MIT 授權)可本地執行。
成本分析 – 為何價格在排名中至關重要
JevBench 報告的是 每 1,000 次決策的成本,而非每 token。Jev 1.13.0 平均每次決策約 950 個輸入 token,因此其 $0.040 成本對應 $0.042 / M 輸入 token(公開 TypeSafe 定價)。最便宜的入場是 classifier.dev(快速層級),每 1k 決策僅 $0.0033,但被列為 榮譽提及,因其僅包裝 Jev 1.13.0 而非獨立模型。
成本欄位對最終分數影響極大:若模型便宜 10 倍,成本軸可獲 30 點。例如,kev 0.6B 在成本軸得 76.1(最低階),但整體僅 62.5,因其智慧(51.9)與校準(51.1)偏低。
不同權重設定下的排名變化
基準提供四種預設權重。以下是每種觀點下的前三名(僅考慮達成 ≥95 % 決策覆蓋率的系統):
| 權重設定 | #1 | #2 | #3 |
|---|---|---|---|
| 官方(各 25 %) | Jev 1.13.0(74.4) | SemIf(73.1) | djev(73.0) |
| 平衡(33 % 智慧,33 % 速度,33 % 成本) | djev(75.8) | Jev 1.13.0(71.8) | SemIf(73.3) |
| 強調準確率 | Jev 1.13.0(77.1) | djev(78.5) | SemIf(75.5) |
| 強調速度 | djev(81.7) | Jev 1.13.0(76.2) | SemIf(77.3) |
| 強調成本 | kev 0.6B(70.4) | Jev 1.13.0(63.1) | SemIf(67.4) |
這些表格顯示,以智慧為主 的權重設定有利於 Jev 1.13.0,而 以成本為主 的設定則使如 kev 0.6B 之類的低成本模型躍居榜首。
各主題領域的準確率(完整套件視角)
基準按主題拆解表現。Jev 1.13.0 在 日常語言(100 % 正確)與 安全與保安(100 %)方面最強。其最弱領域為 金融與商業(73 % 正確)。SemIf 在 程式設計與軟體(96 % 正確)表現出色,但在 規則、政策與法律(64 %)落後。djev 在前三大模型中擁有最高的 困難層級 公共準確率(67 % 正確)。
| 主題 | Jev 1.13.0 | SemIf | djev |
|---|---|---|---|
| 數學與數字 | 87.6 % | 79.1 % | 67.6 % |
| 程式設計與軟體 | 83.9 % | 96.4 % | 71.3 % |
| 規則、政策與法律 | 83.6 % | 64.2 % | 71.3 % |
| 金融與商業 | 73.4 % | 60.9 % | 71.3 % |
| 支援與運作 | 89.1 % | 87.4 % | 88.3 % |
| 日常語言 | 100 % | 100 % | 100 % |
| 安全與保安 | 100 % | 75 % | 95 % |
榮譽提及 – 執行其他參賽者模型的服務
- classifier.dev(快速層級) – 在獨立 API 下運行 Jev 1.13.0,得分 83.6(高於任何排名模型),但列為榮譽提及以避免重複計算同一基礎模型。
- 其他服務(如 Qwen 3.8 27B 透過 Chutes、Needle 3 工具呼叫模式)被標示為 部分執行,因未回答 ≥95 % 的決策集。
為何某些模型未被測量
基準僅在模型無法於相同條件(硬體、授權或端點可用性)下評估時,才報告 部分執行 或 排除 狀態。範例:
- open‑jev(MLX on Apple Silicon) – 無法在基準所用 NVIDIA GPU 上執行。
- mini‑jev – 僅實現部分任務類型(Choice/Noul),缺乏 Score head。
- Needle 3 – 回傳標籤與信心值,而非完整機率分佈,故僅列為部分執行。
- 多個模型需專有授權(如 Gemma 在 Google 條款下)的授權,基準團隊無法代表作者接受。
社群反應(Hacker News)
- @sean_pedersen 質疑重複結果與模型集差異。
- @swyx 連結一討論,其中 Jev 首席执行官解釋為隱私考量而避免公開基準測試。
- @hbrn 指控 Jev 是「詐騙」,因其表現與快速建立的 Qwen 基開源克隆(SemIf)相符,但成本約高出一倍。
- @adityamishra241 問及基準如何防範過度擬合公開的 534 個問題;作者指出,評估期間保留一個 保留的困難層級(109 個項目)作為保密。
- @tamimio 表示對基準發布後一周內出現約 80 個競爭模型感到驚訝。
如何提交新模型或自訂評估
- 在 JevBench 倉儲中開啟 issue(https://github.com/fstandhartinger/jevbench),提供可重現的端點 URL 或可執行的 Docker 映像。
- 提供精確的模型版本、授權,以及訓練期間是否使用任何公開的 JevBench 題目。
- 基準團隊將在完整的 534 決策套件上運行模型,並在下一版本公布結果。
- 若使用私有資料,基準提供 自訂評估 服務(https://benchmarkheaven.com/jev-models/custom-evaluation),可在您防火牆後運行您的模型。
重點摘要
- Jev 1.13.0 在智慧、校準、速度與成本權重相等時,仍是最佳整體決策模型。
- 開源重製版(SemIf、djev、Winnow‑12B Q8)具有高度競爭力,通常在速度或成本上超越商業 API,且分數僅略低於頂尖水平。
- 成本至關重要:最便宜的模型獲得可觀分數,且在成本重視的權重設定下甚至可超越 Jev。
- 透明度:基準公開完整工具、任務定義與每模型成本計算,促進可重現性與公平比較。
- 社群監督嚴謹:多位留言者質疑基準價值、定價方法與過度擬合潛力,凸顯持續獨立評估的必要性。
快速參考表(前五名)
| 排名 | 系統 | 分數 | 成本(美元/1k 決策) | 速度(p95) |
|---|---|---|---|---|
| 1 | Jev 1.13.0 | 74.4 | $0.040 | 0.72 秒 |
| 2 | SemIf | 73.1 | ~$0.022 | 0.78 秒 |
| 3 | djev | 73.0 | $0.026 | 0.31 秒 |
| 4 | Winnow‑12B Q8 | 71.2 | ~$0.037 | 0.98 秒 |
| 5 | reflex 4B | 70.3 | ~$0.022 | 3.75 秒 |
*所有數值均直接取自 JevBench v1.3.0 版本(2026 年 9 月 21 日),未經修改。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch