jeinlee1991/chinese-llm-benchmark
非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。
解决的问题
ReLE 通过提供一个可扩展、结构化的基准测试工具(ReLE,即 Really Reliable Live Evaluation),解决了评估中文大语言模型(LLM)的困难。该项目旨在帮助用户避免“盲目选择”模型,通过提供跨多个领域的详细性能数据,以及一个庞大的模型缺陷库,助力研究与模型改进。
工作原理
ReLE 在七个主要领域和约 300 个细粒度维度上评估数百个商业和开源 LLM。这些领域包括:
- 教育(小学、中学、高中科目及高考)
- 医疗与心理健康
- 金融
- 法律与行政公务员考试
- 推理与数学计算
- 语言与指令遵循
- 代理与工具调用
它提供全面的排行榜、包含超过 200 万条记录的缺陷库,以及一个模型选择工具,允许用户上传自己的测试数据,以找到最适合其特定场景的最具成本效益的模型。
适用人群
- LLM 开发者:利用缺陷库诊断能力异质性并改进模型。
- 企业用户:为特定业务需求选择性能最优且成本最低的 LLM(例如,成本可降低高达 90%)。
- 研究人员:通过结构化基准分析各种中文及全球 LLM 的能力。
亮点
- 超大规模:涵盖 398+ 模型,包括主流商业与开源选项。
- 细粒度评估:在约 300 个维度上进行测试,从牙科等专业领域到普通高中语文。
- 海量缺陷库:包含超过 200 万条已记录的模型失败案例,供社区分析。
- 成本优化工具:支持场景化测试,识别满足性能要求的最廉价模型。
相关
- 项目
- 项目
- 项目
- 项目
- 项目