jeinlee1991/chinese-llm-benchmark
非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat等商用模型, 以及step3.5-flash、kimi-k2.6、ernie4.5、MiniMax-M2.7、deepseek-v4、Qwen3.6、llama4、智谱GLM-5.1、MiMo-V2、LongCat、gemma4、mistral等开源大模型。不仅提供排行榜,也提供规模超200万的大模型缺陷库!方便广大社区研究分析、改进大模型。
何を解決するか
中国語大規模言語モデル(LLM)の評価の難しさに対処するために、スケーラブルで構造的なベンチマークである ReLE(Really Reliable Live Evaluation)を提供します。このプロジェクトは、ユーザーが「盲目的にモデルを選択する」ことを防ぐことを目的としており、多様な分野における詳細なパフォーマンスデータと、研究や改善を支援するための膨大なモデル欠陥ライブラリを提供します。
動作方法
ReLE は、7つの主要分野と約300の細分化された次元で、数百の商用およびオープンソースLLMを評価します。これらの分野には以下が含まれます:
- 教育(小学校、中学校、高等学校の科目および高考)
- 医療および精神健康
- 金融
- 法律および行政職試験
- 推理および数学的計算
- 言語および指示追従
- エージェントおよびツール呼び出し
包括的なランクイング、200万件以上のエントリを含む欠陥ライブラリ、およびユーザーが独自のテストデータをアップロードして特定シナリオに最もコスト効率の良いモデルを特定できるモデル選定ツールを提供します。
対象ユーザー
- LLM開発者:欠陥ライブラリを使って能力の非均一性を診断し、モデルを改善する。
- 企業ユーザー:特定のビジネスニーズ(例:コストを最大90%削減)に最適なパフォーマンスとコスト効率の良いLLMを選定する。
- 研究者:構造化されたベンチマークを通じて、中国語および世界的なLLMの能力を分析する。
特徴
- 大規模スケール:主要な商用およびオープンソースオプションを含む398以上のモデルをカバー。
- 細分化された評価:歯科医学から一般高校中国語まで、約300の次元でテスト。
- 大規模な欠陥ライブラリ:コミュニティ分析用に200万件以上のドキュメント化されたモデル失敗事例を含む。
- コスト最適化ツール:シナリオ固有のテストを可能にし、パフォーマンス要件を満たす最も安価なモデルを特定できる。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト