LiveBench/LiveBench
LiveBench: A Challenging, Contamination-Free LLM Benchmark
解决的问题
LiveBench 解决了 LLM 基准测试中的测试集污染问题,即模型可能在训练阶段见过测试题目,从而导致性能评分虚高。它提供持续更新的具有挑战性的问题集,以确保评估保持客观和可靠。
工作原理
LiveBench 通过每月发布新问题,并从最近发布的数据集、arXiv 论文、新闻文章和 IMDb 电影梗概中获取任务来限制污染。与许多依赖基于 LLM 的评判者的基准测试不同,LiveBench 使用可验证、客观的地面真值答案,可以进行自动评分。目前它涵盖了六个类别中的 18 个多样化任务:推理、数学、编程、语言、数据分析和指令遵循。
适用对象
专为需要客观评估大语言模型 (LLM) 性能且无需担心污染风险的 AI 研究人员和开发人员设计。
亮点
- 无污染设计:每月更新并使用最新的真实世界数据,以保持领先于训练集。
- 客观评分:使用地面真值答案进行自动评分,无需 LLM 评判者。
- 多样化的任务套件:涵盖广泛的能力,包括智能体编程任务(使用 Docker 进行执行)。
- 灵活的评估流水线:支持 OpenAI 兼容的 API、各种模型提供商(Anthropic, Cohere, Mistral 等)以及通过 tmux 进行的并行评估。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目