LiveBench/LiveBench

LiveBench: A Challenging, Contamination-Free LLM Benchmark

解決する課題

LiveBenchは、LLMベンチマークにおけるテストセットの汚染問題に対処します。従来のベンチマークでは、モデルがトレーニング中にテスト問題を目にしている可能性があり、パフォーマンススコアが不当に高く算出されることがありました。LiveBenchは、継続的に更新される難易度の高い問題セットを提供することで、評価の客観性と信頼性を確保します。

仕組み

LiveBenchは、毎月新しい問題を公開し、最近リリースされたデータセット、arXivの論文、ニュース記事、IMDbの映画あらすじからタスクを調達することで、汚染を制限しています。多くのベンチマークがLLMベースの判定者に依存しているのに対し、LiveBenchは自動的にスコアリング可能な、検証可能で客観的な正解(ground-truth)を使用します。現在、推論、数学、コーディング、言語、データ分析、指示遂行の6つのカテゴリにわたる18の多様なタスクをカバーしています。

対象者

汚染のリスクなしに、大規模言語モデル(LLM)の性能を客観的に評価する必要があるAI研究者や開発者向けに設計されています。

ハイライト

  • 汚染のない設計: 毎月の更新と最新の現実世界のデータを使用することで、トレーニングセットに先んじて対応します。
  • 客観的なスコアリング: 正解(ground-truth)を使用して自動スコアリングを行うため、LLM判定者を必要としません。
  • 多様なタスクスイート: エージェント的なコーディングタスク(実行にDockerを使用)を含む幅広い能力をカバーしています。
  • 柔軟な評価パイプライン: OpenAI互換API、さまざまなモデルプロバイダー(Anthropic, Cohere, Mistralなど)、およびtmuxによる並列評価をサポートしています。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト