JevBench v1.3.0 벤치마크에서 Jev 1.13.0이 최고의 결정 모델로 평가되며 오픈소스 대안이 부각됨

JevBench v1.3.0은 Jev 1.13.0을 52개 모델 리더보드 상위에 올림

결과: 공식 JevBench 점수(지능, 캘리브레이션, 속도, 비용의 기하평균)는 Jev 1.13.0을 74.4로 평가하여 테스트된 모든 시스템 중 최고 점수를 기록했습니다. 다음으로 높은 모델은 SemIf(73.1)과 djev(73.0)이며, 이 둘은 벤치마크 공개 후 며칠 만에 추가된 오픈소스 프로젝트입니다.


점수 산정 방식

축 정의 점수 범위
지능 쉬움, 표준, 판정, 어려움 등급의 확률 보정 정확도(어려움 등급은 30% 가중치). 0 = 무작위, 100 = 완벽
캘리브레이션 어려움 등급 확률 항목에 대해: (a) 기대 캘리브레이션 오차 및 (b) 골드 분포에 대한 전체 변동 거리. 0 = 캘리브레이션 불량, 100 = 완벽
속도 단일 요청 실행의 중앙값 및 95번째 백분위 지연 시간(0.1초 = 100점, 10배 느려질수록 20점 감점). 자체 호스팅 엔드포인트는 생산 환경을 근사하기 위해 ×2 + 0.15초로 조정됨. 0 = 느림, 100 = 빠름
비용 1,000건의 결정당 미국 달러($). $0.001 = 100점, 10배 높을수록 30점 감점. 가격은 제공업체의 공식 요금표 또는 크기 클래스 기준 가격을 기반으로 추정됨. 0 = 비쌈, 100 = 무료

최종 JevBench 점수 = (Intelligence × Calibration × Speed × Cost)^{1/4}. 지능이 50 미만인 시스템은 추가 패널티 ((I/50)^2)를 받음.


상위 10개 시스템 순위 (공식 가중치 25%씩)

순위 시스템 점수 지능 캘리브레이션 속도 비용 (USD/1,000건 결정)
1 Jev 1.13.0 (TypeSafe) 74.4 85.7 82.7 83.3 $0.040
2 SemIf (이전 OpenJev, Qwen3.5-4B) 73.1 79.0 72.6 83.7 ~$0.022
3 djev (Maisa, diffusion-gemma) 73.0 82.7 65.4 91.4 $0.026
4 Winnow-12B Q8 71.2 82.0 72.0 82.3 ~$0.037
5 reflex 4B 70.3 80.1 75.2 68.0 ~$0.022
6 jqv (Qwen-32B zero-shot) 68.6 79.3 79.0 74.6 ~$0.056
7 decision-machine-1 (milliseconds.ai) 68.3 62.1 70.4 92.9 $0.035
8 decider-35b-a3b (Mapika) 67.6 79.6 71.5 80.8 ~$0.067
9 open-alternative-jev (IkerMoel) 67.0 64.0 63.2 83.5 ~$0.022
10 system-one-open (Gemma 4 E2B LoRA) 66.6 69.5 56.7 77.0 ~$0.015

모든 점수는 독립된 534건의 결정 세트(220개 어려운 항목)를 기반으로 하며, 2026년 9월 21일 독일의 서버에서 측정됨.


상업적 제품을 능가하는 오픈소스 Jev급 모델들

모델 기반 모델 라이선스 JevBench 점수 주목할 만한 특징
SemIf Qwen-3.5-4B MIT(코드) + Apache-2.0(가중치) 73.1 브라우저에서 실행 가능; 기본 체크포인트 이후의 파인튜닝 없음.
djev DiffusionGemma-26B-A4B (Apache-2.0) Apache-2.0 73.0 단일 스텝 추론 경로 제공; 실험적인 "사고" 모드는 느리고 비쌈.
Winnow-12B Q8 Gemma-12B (양자화됨) Apache-2.0 71.2 양자화 GGUF, 전체 GPU 오프로드; 사적 학습 코퍼스는 공개되지 않음.
reflex 4B Qwen-3.5-4B + LoRA MIT 70.3 각 원시 기능별 캘리브레이션 파일 사용; 상태는 한 번만 인코딩되고 각 옵션은 레이블 로짓에서 읽음.
jqv Qwen-3-32B (기본) Apache-2.0 68.6 제로샷; MMLU 검증 세트에서 온도 조정됨.

이 오픈소스 참가자들은 완전히 재현 가능합니다 – 코드와 가중치가 공개되어 있으며, 벤치마크 허브(미티 라이선스)는 로컬에서 실행할 수 있습니다.


비용 분석 – 왜 가격이 순위에 중요한가

JevBench는 1,000건의 결정당 비용을 보고하며, 토큰당이 아닙니다. Jev 1.13.0의 평균 결정은 약 950개의 입력 토큰을 사용하므로, $0.040의 비용은 공개된 TypeSafe 요금표 기준으로 $0.042/M 입력 토큰에 해당합니다. 가장 저렴한 참가자는 **classifier.dev (빠른 티어)**로 1,000건당 $0.0033이지만, Jev 1.13.0을 단순히 래핑하는 것이므로 영예 있는 언급으로 분류됩니다.

비용 열은 최종 점수에 큰 영향을 미칩니다: 비용이 10배 낮은 모델은 비용 축에서 30점 추가됩니다. 예를 들어, kev 0.6B는 비용 축에서 76.1점을 받지만(가장 저렴한 등급), 지능(51.9)과 캘리브레이션(51.1)이 낮아 전체 점수는 62.5에 불과합니다.


대안 가중치에 따른 순위 변화

벤치마크는 네 가지 사전 설정된 가중치를 제공합니다. 아래는 각 가중치에서 상위 3위 시스템입니다(≥95% 결정 커버리지 기준만 고려):

가중치 1위 2위 3위
공식(각각 25%) Jev 1.13.0 (74.4) SemIf (73.1) djev (73.0)
균형(지능 33%, 속도 33%, 비용 33%) djev (75.8) Jev 1.13.0 (71.8) SemIf (73.3)
정확도 중심 Jev 1.13.0 (77.1) djev (78.5) SemIf (75.5)
속도 중심 djev (81.7) Jev 1.13.0 (76.2) SemIf (77.3)
비용 중심 kev 0.6B (70.4) Jev 1.13.0 (63.1) SemIf (67.4)

이 표들은 지능 중심 가중치는 Jev 1.13.0을 유리하게 하고, 비용 중심 가중치는 kev 0.6B와 같은 저비용 모델을 상위로 밀어올린다는 점을 보여줍니다.


주제별 정확도 (전체 세트 보기)

벤치마크는 주제별 성능을 분석합니다. Jev 1.13.0은 일상 언어(100% 정확)와 안전 및 보안(100% 정확)에서 가장 강력합니다. 가장 약한 분야는 금융 및 상업(73% 정확)입니다. SemIf은 코딩 및 소프트웨어(96% 정확)에서 뛰어나지만, 규칙, 정책 및 법률(64%)에서는 뒤처집니다. djev는 상위 3개 모델 중에서 어려움 등급 공개 정확도가 가장 높습니다(67% 정확).

주제 Jev 1.13.0 SemIf djev
수학 및 숫자 87.6% 79.1% 67.6%
코딩 및 소프트웨어 83.9% 96.4% 71.3%
규칙, 정책 및 법률 83.6% 64.2% 71.3%
금융 및 상업 73.4% 60.9% 71.3%
지원 및 운영 89.1% 87.4% 88.3%
일상 언어 100% 100% 100%
안전 및 보안 100% 75% 95%

영예 있는 언급 – 다른 참가자의 모델을 실행하는 서비스들

  • classifier.dev (빠른 티어) – 별도의 API로 Jev 1.13.0을 실행하여 83.6의 점수를 기록했지만(순위 모델보다 높음), 동일한 기반 모델을 중복 계산하지 않기 위해 영예 있는 언급으로 분류됨.
  • 기타 서비스(예: Qwen 3.8 27B via Chutes, Needle 3의 도구 호출 모드)는 결정 세트의 ≥95%를 답변하지 못했기 때문에 부분 실행으로 표시됨.

일부 모델이 측정되지 않은 이유

벤치마크는 모델이 동일한 조건(하드웨어, 라이선스, 엔드포인트 가용성)에서 평가되지 못할 경우에만 부분 실행 또는 제외 상태를 보고합니다. 예시:

  • open-jev (MLX on Apple Silicon) – 벤치마크에서 사용하는 NVIDIA GPU에서 실행 불가.
  • mini-jev – 작업 유형의 일부(Choice/Noul)만 구현하고, Score 헤드가 없음.
  • Needle 3 – 전체 확률 분포 대신 레이블과 신뢰도를 반환하므로, 부분 실행으로만 기록됨.
  • 여러 모델은 벤치마크 팀이 저자 대신 수락할 수 없는 독점 라이선스(예: Google 조건 하의 Gemma)를 요구함.

커뮤니티 반응 – 허커 뉴스에서

  • @sean_pedersen는 중복 결과와 모델 세트 차이에 대해 의문을 제기함.
  • @swyx는 Jev의 CEO가 개인정보 보호 이유로 공개 벤치마크를 피하기로 결정한 이유를 설명한 논의 링크를 제공함.
  • @hbrn은 Jev가 "사기"라고 주장하며, 비용이 약 두 배인 반면 성능이 빠르게 개발된 Qwen 기반 오픈소스 클론(SemIf)과 일치한다고 비판함.
  • @adityamishra241는 벤치마크가 공개된 534개 질문에 과적합되는지 어떻게 방지하는지 묻고, 저자들은 평가 중에 비공개로 유지된 보류된 어려움 등급(109개 항목)이 있음을 언급함.
  • @tamimio는 벤치마크 공개 후 일주일 내 약 80개의 경쟁 모델이 급속히 등장한 것에 놀랐다고 표현함.

새로운 모델 또는 커스텀 평가 제출 방법

  1. JevBench 저장소(https://github.com/fstandhartinger/jevbench)에서 재현 가능한 엔드포인트 URL 또는 실행 가능한 Docker 이미지를 포함한 이슈를 열기.
  2. 정확한 모델 버전, 라이선스, 그리고 학습 중에 공개된 JevBench 항목을 사용했는지 제공하기.
  3. 벤치마크 팀은 모델을 전체 534건 결정 세트로 실행하고 다음 버전에 결과를 게시함.
  4. 비공개 데이터의 경우, 벤치마크는 커스텀 평가 서비스(https://benchmarkheaven.com/jev-models/custom-evaluation)를 제공하여 모델을 귀하의 방화벽 뒤에서 동일한 허브로 실행함.

주요 결론

  • Jev 1.13.0은 지능, 캘리브레이션, 속도, 비용을 동일하게 가중할 때 가장 종합적인 결정 모델입니다.
  • 오픈소스 재구성 모델(SemIf, djev, Winnow-12B Q8)은 매우 경쟁력이 있으며, 종종 상업용 API보다 속도나 비용에서 우수하면서도 상위 점수와 몇 점 차이로 격차를 유지합니다.
  • 비용은 중요합니다: 가장 저렴한 모델도 존경할 만한 점수를 기록하며, 비용 중심 가중치에서는 Jev를 능가할 수 있습니다.
  • 투명성: 벤치마크는 전체 허브, 작업 정의, 모델별 비용 계산을 공개하여 재현 가능성과 공정한 비교를 가능하게 합니다.
  • 커뮤니티의 엄격한 검토: 여러 댓글러들이 벤치마크의 가치, 가격 산정 방식, 과적합 가능성에 도전하며, 지속적인 독립적 평가의 필요성을 강조합니다.

빠른 참고 표 (상위 5위)

순위 시스템 점수 비용 (USD/1,000건 결정) 속도 (p95)
1 Jev 1.13.0 74.4 $0.040 0.72 s
2 SemIf 73.1 ~$0.022 0.78 s
3 djev 73.0 $0.026 0.31 s
4 Winnow-12B Q8 71.2 ~$0.037 0.98 s
5 reflex 4B 70.3 ~$0.022 3.75 s

모든 수치는 JevBench v1.3.0 릴리스(2026년 9월 21일)에서 직접 인용되었으며, 수정되지 않았습니다.

Sources

관련