jeinlee1991/chinese-llm-benchmark

非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。

解決的問題

ReLE 透過提供一個可擴展、結構化的基準測試工具(ReLE,即 Really Reliable Live Evaluation),解決了評估中文大型語言模型(LLM)的困難。此專案旨在幫助使用者避免「盲目選擇」模型,透過提供跨多個領域的詳細性能資料,以及一個龐大的模型缺陷資料庫,協助研究與模型改進。

作法

ReLE 在七個主要領域與約 300 個細粒度維度上評估數百個商業與開源 LLM。這些領域包括:

  • 教育(小學、中學、高中科目及高考)
  • 醫療與心理健康
  • 金融
  • 法律與行政公務員考試
  • 推理與數學計算
  • 語言與指令遵循
  • 代理與工具呼叫

提供全面的排行榜、包含超過 200 萬筆記錄的缺陷資料庫,以及一個模型選擇工具,允許使用者上傳自己的測試資料,以找到最符合其特定情境的最具成本效益的模型。

適用對象

  • LLM 開發者:利用缺陷資料庫診斷能力異質性並改進模型。
  • 企業使用者:為特定業務需求選擇性能最佳且成本最低的 LLM(例如,成本可降低高達 90%)。
  • 研究人員:透過結構化基準分析各種中文及全球 LLM 的能力。

亮點

  • 超大規模:涵蓋 398+ 模型,包括主流商業與開源選項。
  • 細粒度評估:在約 300 個維度上進行測試,從牙科等專業領域到一般高中語文。
  • 海量缺陷資料庫:包含超過 200 萬筆已記錄的模型失敗案例,供社群分析。
  • 成本優化工具:支援情境化測試,識別滿足性能要求的最廉價模型。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案