Ed‑o‑meter 벤치마크: GLM‑5.3, Anthropic 및 OpenAI 모델보다 1/5의 비용으로 승리

GLM‑5.3, Ed‑o‑meter 랭킹에서 독보적 성과, GPT‑5.5 비용의 약 1/5로 100 % 통과율 기록

핵심 요약: 최신 Ed‑o‑meter 벤치마크에서 오픈웨이트 GLM‑5.3 모델은 모든 테스트 코너에서 완벽한 통과율을 달성했으며, 9.3점의 루브릭 점수와 총 랩 비용 $0.28을 기록했습니다. 이는 GPT‑5.5의 $1.43 가격의 약 20 %에 불과합니다. 일반 목적 작업에 최적의 단일 모델 선택이며, 특정 용도에는 더 빠르거나 저렴한 대안이 존재합니다.


벤치마크 방법론은 17개 모델에 걸쳐 투명하고 일관성 있음

결론: Ed‑o‑meter는 동일한 프롬프트, 결정론적 평가, 단일 OpenRouter 스트리밍 경로를 사용해 모든 모델에 대해 동일한 28개의 실제 세계 작업을 실행하므로, 차이점은 모델의 행동에 기인하며 실험적 변동성과 무관합니다.

  • 모든 모델은 고정된 '랩'에서 평가되었으며, 이는 코딩, 데이터, 현실 세계, 보안, 도구 사용의 다섯 개 코너로 구성되며, 각 코너에는 여러 개의 유닛테스트 스타일 작업이 포함됩니다.
  • 각 모델은 작업당 한 번만 실행되었기 때문에, 통과율은 윌슨 95 % 신뢰구간으로 보고됩니다.
  • 지연 시간은 동일한 스트리밍 조건 하에서 중앙값 시간-첫 토큰( TTFT)으로 측정됩니다.
  • 비용은 제공업체가 제시한 토큰당 비용을 답변 시도에만 적용하여 계산되며, 거부 사례는 별도로 기록됩니다.
  • LLM 루브릭(품질 점수)은 별도의 모델(fable‑5)이 저장된 답변 텍스트를 기반으로 생성되며, 자체 편향은 각주에 공개됩니다.
  • 전체 허니스, 작업 정의, 바이너리 체커는 MIT 라이선스 하에 오픈소스로 제공되는 Featherbench 저장소에 포함되어 있습니다.

종합 결과, GLM‑5.3는 품질과 비용 효율성 모두에서 최상위에 위치

결론: GLM‑5.3는 다섯 개의 코너 전부에서 100 % 통과율을 달성했으며, 9.3점의 루브릭 점수와 랩당 $0.28의 비용을 기록해, 모든 모델 중 유일하게 완벽한 성과를 보였습니다.

순위 모델 통과율 (95 % CI) 루브릭 보안 통과 TTFT 랩 비용 작업당 비용
1 glm‑5.3 100 % [88–100] 9.3 100 % 16.3 s $0.28 $0.0101
2 deepseek‑v4‑pro 96 % [82–99] 8.7 83 % 40.0 s $0.081 $0.0029
3 gemini‑3.6‑flash 96 % [82–99] 8.8 83 % 6.6 s $0.48 $0.0170
4 gpt‑5.5 96 % [82–99] 8.7 100 % 13.2 s $1.43 $0.0510
  • 표는 상위 네 개 모델을 보여주며, 전체 랭킹에는 17개 모델이 포함됩니다.

모델별 주요 특징

GLM‑5.3, 종합 우승자

결론: GLM‑5.3는 코딩, 데이터, 현실 세계, 보안, 도구 사용의 모든 코너에서 100 % 통과율을 기록해, 16.3 s의 다소 높은 TTFT에도 불구하고 가장 안전한 단일 모델 선택입니다.

  • 그 루브릭 점수 9.3은 모든 모델 중 세 번째로 높습니다.
  • 작업당 비용($0.0101)은 모든 폐쇄형 소스 경쟁 모델보다 크게 낮습니다.
  • 느린 응답 시간이 주요 트레이드오프이며, 지연 시간이 중요한 애플리케이션의 경우 GPT‑5.5가 더 빠르고(13.2 s), 보안 성능은 유사합니다.

GPT‑5.5, 최고의 속도-품질 비율 제공

결론: GPT‑5.5는 GLM‑5.3와 동일한 100 % 보안 통과율과 89 %의 현실 세계 통과율을 달성하며 13.2 s의 TTFT를 제공하지만, 랩 비용은 $1.43로 약 5배 높습니다.

GPT‑5.6‑luna, 고용량 저위험 작업에 최적의 저비용 모델

결론: 랩당 $0.064($0.0023/작업)의 비용과 5.3 s의 TTFT로, 가끔의 실패가 허용되는 배치 작업에 이상적입니다.

  • 전체 통과율은 79 %이며, 보안 통과율은 33 %로 떨어지므로, 생산 환경에 배포하기 전 반드시 결과를 검증해야 합니다.

Haiku‑4‑5, 적은 비용으로 초저지연 제공

결론: Haiku‑4‑5는 0.9 s 내에 응답하며, 랩당 $0.12의 비용으로 96 %의 전체 통과율을 달성해, 인터랙티브 사용 사례에서 가장 빠른 모델입니다.

Kimi‑K3, 최고의 루브릭 점수(9.5) 기록

결론: Kimi‑K3의 루브릭 점수 9.5는 가장 높은 평가된 답변 품질을 의미하지만, 26.4 s의 TTFT와 75 %의 데이터 코너 통과율로 실시간 애플리케이션에 적합하지 않습니다.

Opus‑5, 제공업체 측 필터링으로 인한 측정 오류

결론: Opus‑5의 43 % 코딩 통과율은 실제 능력 부족이 아니라, 생성 시작 전에 네 개의 무해한 coding‑debug‑* 작업이 차단되어 실패 수가 과대 집계되었기 때문입니다.


안전성 결과, GPT‑5.6 계열의 약점 드러남

결론: GPT‑5.6 트리오(luna, terra, sol)는 12개 보안 셀 중 11개에서 절차적 탈옥 카나리를 트리거해 낮은 보안 통과율(33 %–50 %)을 보였습니다.

  • 반면, GPT‑5.5, Claude의 Haiku 시리즈, Opus‑5 모델은 모두 100 % 보안 통과율을 기록했습니다.
  • GPT‑5.6 변형 모델을 배포할 때는 강력한 레드팀링과 외부 필터를 사용해야 합니다.

커뮤니티 반응, 신뢰성에 대한 의문과 찬사 공존

결론: Hacker News 사용자들은 벤치마크의 투명성에 대한 찬사를 보내는 동시에, Haiku 모델의 높은 점수와 자체 평가 루브릭에 대한 유효성에 대한 의심을 제기하며 분열된 반응을 보였습니다.

"이 전체 결과는 즉시 Claude가 생성한 것처럼 보여서 진지하게 받아들이기 어렵습니다. 왜 이런 결과가 기존의 진지한 LLM 벤치마크와 모순되는 것일까요?" – hellohello2

"거의 10개의 모델이 95 % 이상의 벤치마크 통과율을 기록하고 있는데, 이 정도로 과도하게 포화된 것은 아닐까요? 또한, Haiku 모델이 매우 높은 순위에 올라간 벤치마크에 대해 매우 회의적입니다." — jchw

"한 가지 문제는 $30의 실행 비용이 많은 검증 가능한 작업에서 매우 노이즈가 많다는 점입니다. 우리는 다중 에이전트 코딩 평가에서 GLM‑5.3 결과를 최근 발표했는데, 확실히 인상적인 모델이며, 순위는 약 #6 정도입니다. 가격 대비로 보면 파레토 최적은 아니며, Grok‑4.6보다 약간 뒤처지는데, 이는 더 빠르고 동일한 가격입니다." — gertlabs

"저는 개인 프로젝트에서는 오픈 모델을 매일 사용하고, 업무에서는 폐쇄 모델을 사용합니다. 오픈 모델은 Fable보다는 물론이고 Opus보다도 확실히 뒤처지고 있습니다. 이 모든 글들은 동기 부여나 희망적인 사고에 불과해 보입니다." — solenoid0937

"모델 하나만 실행한다면, glm‑5.3를 실행하세요. 하지만 이건 끔찍한 결론입니다. 28개의 작업과 대부분의 모델이 높은 통과율을 기록한 상황에서, 거의 아무런 정보를 주지 않습니다. 사용 사례에 맞는 모델을 테스트하고, 사용 사례를 100 % 충족시키는 가장 빠르고 작고 저렴한 모델을 사용하세요." — CMay

이 댓글들은 세 가지 반복적인 우려를 드러냅니다:

  1. 벤치마크의 포괄성 – 28개 작업은 실제 세계의 복잡성을 모두 포괄하지 못할 수 있습니다.
  2. 루브릭 편향 – 품질 점수는 fable‑5가 생성하며, 스스로 평가하므로 자가 편향이 있을 수 있습니다.
  3. 제공업체 필터링 영향 – 차단된 작업(예: Opus‑5의 coding‑debug)은 통과율을 인위적으로 낮출 수 있습니다.

저자들이 공개한 한계와 주의사항

결론: Ed‑o‑meter 저자들은 잠재적 왜곡의 네 가지 주요 원인을 인정합니다.

  1. 루브릭 평가는 fable‑5에 의해 후행적으로 수행되며, 자가 평가임이 표에 명시됩니다.
  2. fable‑5의 자체 루브릭(9.3) 은 제한된 11회 시험 샘플에 기반하며, 상향 편향이 있을 수 있습니다.
  3. 레시피 체커의 거짓 긍정으로 인해, 세 모델이 비건 레시피 작업에서 비용 성분 언급 없이도 통과로 표시되었습니다.
  4. fable‑5와 opus‑5의 비용 계산은 거부 사례를 제외했으며, 이 경우 해당 모델이 더 저렴하게 보일 수 있습니다.

직접 Ed‑o‑meter 실행하기

결론: 벤치마크는 완전히 재현 가능하며, 누구나 Featherbench 저장소를 클론하여 추가 모델을 평가할 수 있습니다.

  • 허니스, 작업 정의, 바이너리 체커는 https://github.com/ed‑is‑ai/featherbench (MIT 라이선스)에서 제공됩니다.
  • 새로운 모델 요청은 모델 이름, API 경로, 근거를 포함한 GitHub 이슈를 열어주세요.
  • 현재 가격 체계 기준으로 전체 28개 작업을 실행하는 데 약 $30가 소요되며, 소규모 연구에 부담 없는 비용입니다.

결론

결론: GLM‑5.3는 현재 보편적인 정확성, 합리적인 지연 시간, 초저비용의 최적 조합을 제공하며, 단일 신뢰할 수 있는 LLM이 필요한 개발자에게 기본 선택지로 적합합니다. 더 빠른 대안(GPT‑5.5, Haiku‑4‑5)과 더 저렴한 배치 중심 모델(GPT‑5.6‑luna)은 특정 역할을 수행하며, GPT‑5.6 계열의 보안 약점과 Opus‑5에 영향을 미치는 필터링 오류는 모델 행동이 자체 안전 요구사항과 일치하는지 검증해야 함을 상기시킵니다.


간단한 핵심 수치 요약

지표 GLM‑5.3 GPT‑5.5 GPT‑5.6‑luna Haiku‑4‑5
전체 통과율 100 % 96 % 79 % 96 %
보안 통과율 100 % 100 % 33 % 100 %
루브릭 9.3 8.7 8.6 (자기 평가) 7.4
TTFT 16.3 s 13.2 s 5.3 s 0.9 s
랩 비용 $0.28 $1.43 $0.064 $0.12
작업당 비용 $0.0101 $0.0510 $0.0023 $0.0044

미래 작업 방향

  • 28개 이상의 작업으로 범위 확장하면 통계적 노이즈를 줄이고 통과율 차이에 대한 신뢰도를 높일 수 있습니다.
  • 모델당 여러 번의 실행을 도입하면 윌슨 구간을 좁히고 변동성을 드러낼 수 있습니다.
  • 독립적이고 자가 편향이 없는 평가자로 루브릭을 재평가하면 fable‑5의 자가 평가에 대한 우려를 해결할 수 있습니다.
  • 다양한 라우팅 제공업체를 통해 TTFT를 추적하면 네트워크 수준의 지연 효과를 발견할 수 있습니다.

실무자들을 위한 핵심 요약: 일반 작업에는 GLM‑5.3를 시작으로, 지연 시간이 중요한 경우 GPT‑5.5로 전환하고, 보안 관련 실패를 수용할 수 있는 고처리량 파이프라인에는 GPT‑5.6‑luna를 사용하세요. 언제나 생산 배포 전에 자체 도메인 특화 작업에 대해 모델을 검증하세요.

Sources

관련