JevBench v1.3.0 ベンチマークで Jev 1.13.0 が最優秀意思決定モデルに、オープンソースの代替案も浮き彫りに

JevBench v1.3.0 で Jev 1.13.0 が 52 モデルのリーダーボードで首位に

結果: 公式の JevBench スコア(知能、キャリブレーション、スピード、コストの幾何平均)により、Jev 1.13.0 が 74.4 というスコアで、テストされたすべてのシステムの中で最高位にランクインしました。次に高いのは SemIf(73.1)と djev(73.0)であり、両方ともベンチマーク公開後数日以内に追加されたオープンソースプロジェクトです。


スコアの算出方法

軸 定義 スコア範囲
知能 決定難易度(簡単・標準・審査・難しい)の各段階における確率補正済み精度(難しい段階は重み 30 %)。 0 = ランダム、100 = 完璧
キャリブレーション 難しい段階の確率項目について: (a) 期待キャリブレーション誤差および (b) ゴールド分布との全変動距離。 0 = キャリブレーション不備、100 = 完璧
スピード 単一リクエスト実行時の中央値および 95th パーセンタイル遅延(0.1 s = 100、10倍遅くなるごとに 20点減点)。セルフホステッドエンドポイントは、本番負荷を想定して ×2 + 0.15 s で調整される。 0 = 遅い、100 = 速い
コスト 1,000 決定あたりの US $(トークン単位ではない)。$0.001 = 100、10倍高くなるごとに 30点減点。価格はプロバイダーの公表料金またはサイズクラスの参考レートに基づく推定値。 0 = 高価、100 = 無料

最終的な JevBench スコア = (Intelligence × Calibration × Speed × Cost)^{1/4}。知能 < 50 のシステムには追加ペナルティ ((I/50)^2) が適用される。


上位10位のシステム(公式重み 25 % 各々)

順位 システム スコア 知能 キャリブレーション スピード コスト(USD/1k 決定)
1 Jev 1.13.0 (TypeSafe) 74.4 85.7 82.7 83.3 $0.040
2 SemIf (旧 OpenJev、Qwen3.5‑4B) 73.1 79.0 72.6 83.7 ~$0.022
3 djev (Maisa、diffusion‑gemma) 73.0 82.7 65.4 91.4 $0.026
4 Winnow‑12B Q8 71.2 82.0 72.0 82.3 ~$0.037
5 reflex 4B 70.3 80.1 75.2 68.0 ~$0.022
6 jqv (Qwen‑32B zero‑shot) 68.6 79.3 79.0 74.6 ~$0.056
7 decision‑machine‑1 (milliseconds.ai) 68.3 62.1 70.4 92.9 $0.035
8 decider‑35b‑a3b (Mapika) 67.6 79.6 71.5 80.8 ~$0.067
9 open‑alternative‑jev (IkerMoel) 67.0 64.0 63.2 83.5 ~$0.022
10 system‑one‑open (Gemma 4 E2B LoRA) 66.6 69.5 56.7 77.0 ~$0.015

すべてのスコアは、ドイツのサーバー上で 2026 年 9 月 21 日に測定された、変更されていない 534 決定セット(220 個の難問)に基づく。


商業製品を上回るオープンソースの Jev クラスモデル

モデル 基盤モデル ライセンス JevBench スコア 特徴
SemIf Qwen‑3.5‑4B MIT(コード)+ Apache‑2.0(重み) 73.1 ブラウザ内実行可能;ベースチェックポイント以降のファインチューニングなし。
djev DiffusionGemma‑26B‑A4B(Apache‑2.0) Apache‑2.0 73.0 1 ステップ推論パスを提供;実験的「思考」モードは遅く、コストが高い。
Winnow‑12B Q8 Gemma‑12B(量子化済み) Apache‑2.0 71.2 量子化 GGUF、GPUフルオフロード;プライベートトレーニングコーパスは未公開。
reflex 4B Qwen‑3.5‑4B + LoRA MIT 70.3 プリミティブごとのキャリブレーションファイルを使用;状態は一度エンコードされ、各選択肢はラベルロジットから読み取られる。
jqv Qwen‑3‑32B(ストック) Apache‑2.0 68.6 ゼロショット;温度パラメータは MMLU バリデーションで最適化。

これらのオープンソース参入モデルは 完全に再現可能 であり、コードと重みが公開されており、ベンチマークハーネス(MITライセンス)はローカルで実行可能である。


コスト分析 – スコアランキングにおける価格の重要性

JevBench は、トークン単位ではなく 1,000 決定あたりのコスト を報告している。Jev 1.13.0 の平均入力トークン数は約 950 であるため、$0.040 のコストは、公開されている TypeSafe の料金に基づいて $0.042 / M 入力トークンに相当する。最も安い参加者は classifier.dev(ファストティア) で 1k 決定あたり $0.0033 だが、これは単に Jev 1.13.0 をラッピングしているだけなので 表彰候補 として扱われている。

コスト欄は最終スコアに大きく影響する:10倍安ければコスト軸で 30 点増加する。たとえば、kev 0.6B はコスト軸で 76.1 を獲得(最安層)だが、知能(51.9)とキャリブレーション(51.1)が低いため、全体スコアは 62.5 に留まる。


代替重み付けでの順位変化

ベンチマークは4つの事前設定重み付けを提供している。以下は各重み付けでの上位3位(≥95 % 決定カバレッジ基準を満たしたシステムのみ考慮):

重み付け #1 #2 #3
公式(各25 %) Jev 1.13.0(74.4) SemIf(73.1) djev(73.0)
バランス(知能33 %、スピード33 %、コスト33 %) djev(75.8) Jev 1.13.0(71.8) SemIf(73.3)
精度重視 Jev 1.13.0(77.1) djev(78.5) SemIf(75.5)
スピード重視 djev(81.7) Jev 1.13.0(76.2) SemIf(77.3)
コスト重視 kev 0.6B(70.4) Jev 1.13.0(63.1) SemIf(67.4)

この表は、知能重視の重み付けでは Jev 1.13.0 が有利である一方、コスト重視の重み付けでは低コストモデル(例: kev 0.6B)がトップに躍り出ることを示している。


分野別精度(フルスイートビュー)

ベンチマークはトピック別に性能を分解している。Jev 1.13.0 は 日常言語(100 % 正解)と 安全・セキュリティ(100 % 正解)で最も強力である。最も弱い分野は 金融・商業(73 % 正解)である。SemIf は コーディング・ソフトウェア(96 % 正解)で優れているが、規則・政策・法(64 %)では遅れをとっている。djev はトップ3の中で最も高い 難問レベル の公開精度(67 % 正解)を達成している。

分野 Jev 1.13.0 SemIf djev
数学・数字 87.6 % 79.1 % 67.6 %
コーディング・ソフトウェア 83.9 % 96.4 % 71.3 %
規則・政策・法 83.6 % 64.2 % 71.3 %
金融・商業 73.4 % 60.9 % 71.3 %
サポート・運用 89.1 % 87.4 % 88.3 %
日常言語 100 % 100 % 100 %
安全・セキュリティ 100 % 75 % 95 %

表彰候補 – 他の参加者のモデルを実行するサービス

  • classifier.dev(ファストティア) – 別の API で Jev 1.13.0 を実行し、スコア 83.6(ランクインモデルより高い)を記録したが、同じモデルを二重にカウントしないよう表彰候補として扱われる。
  • その他のサービス(例: Qwen 3.8 27B via Chutes、Needle 3 のツールコールモード)は、決定セットの ≥95 % を回答しなかったため、部分実行 として表示される。

なぜ一部のモデルが測定されなかったのか

ベンチマークは、ハードウェア、ライセンス、エンドポイントの可用性などの条件で評価不可能な場合にのみ 部分実行 または 除外 状態を報告する。例:

  • open‑jev(MLX on Apple Silicon)– ベンチマークで使用される NVIDIA GPU 上で動作できない。
  • mini‑jev – タスクタイプ(Choice/Noul)のサブセットしか実装せず、スコアヘッドが欠如している。
  • Needle 3 – 完全な確率分布ではなく、ラベルと信頼度を返すため、部分実行 としてリストアップされる。
  • 複数のモデルは、ベンチマークチームが著者代表として受け入れられないプロプライエタリライセンス(例: Google の条件下の Gemma)が必要だった。

Hacker News でのコミュニティ反応

  • @sean_pedersen 重複結果とモデルセットの違いについて疑問を呈した。
  • @swyx 本人がプライバシー上の理由から公開ベンチマークを避ける決断を説明した、Jev 社長の発言へのリンクを掲載した。
  • @hbrn Jev が「詐欺」と非難された。それは、迅速に構築された Qwen 基底のオープンソースクローン(SemIf)と性能が一致する一方、費用は約2倍であることから。
  • @adityamishra241 ベンチマークが公開された 534 問に過剰適合していないかを尋ねた。著者らは、評価時に秘密保持される ホールドアウト難問層(109件)が存在することを指摘した。
  • @tamimio ベンチマーク公開後1週間で約80もの競合モデルが急速に登場したことに驚いた。

新しいモデルやカスタム評価の提出方法

  1. JevBench リポジトリ(https://github.com/fstandhartinger/jevbench)で再現可能なエンドポイント URL または実行可能な Docker イメージを含むイシューを開く。
  2. 精確なモデルバージョン、ライセンス、およびトレーニング中に公開 JevBench アイテムが使用されたかどうかを提示する。
  3. ベンチマークチームは、モデルを全 534 決定セットで実行し、次のバージョンで結果を公開する。
  4. プライベートデータ向けには、ベンチマークは カスタム評価 サービス(https://benchmarkheaven.com/jev-models/custom-evaluation)を提供しており、あなたのファイアウォールの裏で同じハーネスでモデルを実行できる。

主な教訓

  • Jev 1.13.0 は、知能、キャリブレーション、スピード、コストを等しく重み付けた場合、最良の総合的意思決定モデルである。
  • オープンソース再実装(SemIf、djev、Winnow‑12B Q8)は非常に競争力があり、速度やコストで商業APIを上回りながら、トップスコアに数ポイント以内で迫っている。
  • コストは重要:最も安いモデルでも respectable スコアを達成でき、コスト重視の重み付けでは Jev を上回る可能性がある。
  • 透明性:ベンチマークはフルハーネス、タスク定義、各モデルのコスト計算を公開しており、再現性と公正な比較を可能にしている。
  • コミュニティの監視は厳しい:いくつかのコメントはベンチマークの価値、価格手法、過剰適合の可能性を疑問視しており、継続的な独立評価の必要性を強調している。

速報表(上位5位)

順位 システム スコア コスト(USD/1k 決定) スピード(p95)
1 Jev 1.13.0 74.4 $0.040 0.72 s
2 SemIf 73.1 ~$0.022 0.78 s
3 djev 73.0 $0.026 0.31 s
4 Winnow‑12B Q8 71.2 ~$0.037 0.98 s
5 reflex 4B 70.3 ~$0.022 3.75 s

すべての数値は、JevBench v1.3.0 リリース(2026 年 9 月 21 日)から直接取得され、改訂されていない。

Sources

関連