LiveBench/LiveBench
LiveBench: A Challenging, Contamination-Free LLM Benchmark
解決する課題
LiveBenchは、LLMベンチマークにおけるテストセットの汚染問題に対処します。従来のベンチマークでは、モデルがトレーニング中にテスト問題を目にしている可能性があり、パフォーマンススコアが不当に高く算出されることがありました。LiveBenchは、継続的に更新される難易度の高い問題セットを提供することで、評価の客観性と信頼性を確保します。
仕組み
LiveBenchは、毎月新しい問題を公開し、最近リリースされたデータセット、arXivの論文、ニュース記事、IMDbの映画あらすじからタスクを調達することで、汚染を制限しています。多くのベンチマークがLLMベースの判定者に依存しているのに対し、LiveBenchは自動的にスコアリング可能な、検証可能で客観的な正解(ground-truth)を使用します。現在、推論、数学、コーディング、言語、データ分析、指示遂行の6つのカテゴリにわたる18の多様なタスクをカバーしています。
対象者
汚染のリスクなしに、大規模言語モデル(LLM)の性能を客観的に評価する必要があるAI研究者や開発者向けに設計されています。
ハイライト
- 汚染のない設計: 毎月の更新と最新の現実世界のデータを使用することで、トレーニングセットに先んじて対応します。
- 客観的なスコアリング: 正解(ground-truth)を使用して自動スコアリングを行うため、LLM判定者を必要としません。
- 多様なタスクスイート: エージェント的なコーディングタスク(実行にDockerを使用)を含む幅広い能力をカバーしています。
- 柔軟な評価パイプライン: OpenAI互換API、さまざまなモデルプロバイダー(Anthropic, Cohere, Mistralなど)、およびtmuxによる並列評価をサポートしています。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト