LiveBench/LiveBench

LiveBench: A Challenging, Contamination-Free LLM Benchmark

解决的问题

LiveBench 解决了 LLM 基准测试中的测试集污染问题,即模型可能在训练阶段见过测试题目,从而导致性能评分虚高。它提供持续更新的具有挑战性的问题集,以确保评估保持客观和可靠。

工作原理

LiveBench 通过每月发布新问题,并从最近发布的数据集、arXiv 论文、新闻文章和 IMDb 电影梗概中获取任务来限制污染。与许多依赖基于 LLM 的评判者的基准测试不同,LiveBench 使用可验证、客观的地面真值答案,可以进行自动评分。目前它涵盖了六个类别中的 18 个多样化任务:推理、数学、编程、语言、数据分析和指令遵循。

适用对象

专为需要客观评估大语言模型 (LLM) 性能且无需担心污染风险的 AI 研究人员和开发人员设计。

亮点

  • 无污染设计:每月更新并使用最新的真实世界数据,以保持领先于训练集。
  • 客观评分:使用地面真值答案进行自动评分,无需 LLM 评判者。
  • 多样化的任务套件:涵盖广泛的能力,包括智能体编程任务(使用 Docker 进行执行)。
  • 灵活的评估流水线:支持 OpenAI 兼容的 API、各种模型提供商(Anthropic, Cohere, Mistral 等)以及通过 tmux 进行的并行评估。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目