jeinlee1991/chinese-llm-benchmark

非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。

解决的问题

ReLE 通过提供一个可扩展、结构化的基准测试工具(ReLE,即 Really Reliable Live Evaluation),解决了评估中文大语言模型(LLM)的困难。该项目旨在帮助用户避免“盲目选择”模型,通过提供跨多个领域的详细性能数据,以及一个庞大的模型缺陷库,助力研究与模型改进。

工作原理

ReLE 在七个主要领域和约 300 个细粒度维度上评估数百个商业和开源 LLM。这些领域包括:

  • 教育(小学、中学、高中科目及高考)
  • 医疗与心理健康
  • 金融
  • 法律与行政公务员考试
  • 推理与数学计算
  • 语言与指令遵循
  • 代理与工具调用

它提供全面的排行榜、包含超过 200 万条记录的缺陷库,以及一个模型选择工具,允许用户上传自己的测试数据,以找到最适合其特定场景的最具成本效益的模型。

适用人群

  • LLM 开发者:利用缺陷库诊断能力异质性并改进模型。
  • 企业用户:为特定业务需求选择性能最优且成本最低的 LLM(例如,成本可降低高达 90%)。
  • 研究人员:通过结构化基准分析各种中文及全球 LLM 的能力。

亮点

  • 超大规模:涵盖 398+ 模型,包括主流商业与开源选项。
  • 细粒度评估:在约 300 个维度上进行测试,从牙科等专业领域到普通高中语文。
  • 海量缺陷库:包含超过 200 万条已记录的模型失败案例,供社区分析。
  • 成本优化工具:支持场景化测试,识别满足性能要求的最廉价模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目