jeinlee1991/chinese-llm-benchmark
非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。
해결하는 문제
중국어 대규모 언어 모델(LLM) 평가의 어려움을 해결하기 위해 확장 가능하고 구조적인 벤치마크인 ReLE(Really Reliable Live Evaluation)를 제공합니다. 이 프로젝트는 사용자가 "맹목적으로 모델을 선택하는 것"을 피할 수 있도록 다양한 분야에서의 세부 성능 데이터와 모델 결함의 거대한 라이브러리를 제공함으로써 연구 및 개선을 지원합니다.
작동 방식
ReLE는 7개의 주요 분야와 약 300개의 세부 차원에서 수백 개의 상용 및 오픈소스 LLM을 평가합니다. 주요 분야는 다음과 같습니다:
- 교육 (초등, 중등, 고등학교 과목 및 고고사)
- 의료 및 정신 건강
- 금융
- 법률 및 행정 공무원 시험
- 추론 및 수학 계산
- 언어 및 지시 따르기
- 에이전트 및 도구 호출
포괄적인 랭킹, 200만 건 이상의 항목을 포함하는 결함 라이브러리, 그리고 사용자가 자신의 테스트 데이터를 업로드하여 특정 시나리오에 가장 비용 효율적인 모델을 찾을 수 있는 모델 선택 도구를 제공합니다.
대상 사용자
- LLM 개발자: 결함 라이브러리를 활용해 능력의 비균질성을 진단하고 모델을 개선합니다.
- 기업 사용자: 특정 비즈니스 요구사항(예: 비용을 최대 90% 절감)에 가장 성능이 우수하고 비용 효율적인 LLM을 선택합니다.
- 연구자: 구조화된 벤치마크를 통해 다양한 중국어 및 글로벌 LLM의 능력을 분석합니다.
주요 특징
- 거대한 규모: 주요 상용 및 오픈소스 옵션을 포함해 398개 이상의 모델을 커버합니다.
- 세부 평가: 치과와 같은 전문 분야부터 일반 고등학교 중국어까지 약 300개의 차원에서 테스트합니다.
- 거대한 결함 라이브러리: 커뮤니티 분석을 위한 200만 건 이상의 문서화된 모델 실패 사례를 포함합니다.
- 비용 최적화 도구: 시나리오별 테스트를 가능하게 하여 성능 요구 사항을 충족하는 가장 저렴한 모델을 식별할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트