LiveBench/LiveBench

LiveBench: A Challenging, Contamination-Free LLM Benchmark

解決的問題

LiveBench 解決了 LLM 基準測試中的測試集污染問題,即模型可能在訓練階段看過測試題目,導致性能評分虛高。它提供持續更新且具挑戰性的問題集,以確保評估保持客觀與可靠。

工作原理

LiveBench 透過每月發布新問題,並從最近發布的數據集、arXiv 論文、新聞文章和 IMDb 電影梗概中獲取任務來限制污染。與許多依賴基於 LLM 的評判者的基準測試不同,LiveBench 使用可驗證、客觀的地面真值答案,可以進行自動評分。目前它涵蓋了六個類別中的 18 個多樣化任務:推理、數學、程式設計、語言、數據分析與指令遵循。

適用對象

專為需要客觀評估大語言模型 (LLM) 性能且無需擔心污染風險的 AI 研究人員與開發人員設計。

亮點

  • 無污染設計:每月更新並使用最新的真實世界數據,以保持領先於訓練集。
  • 客觀評分:使用地面真值答案進行自動評分,無需 LLM 評判者。
  • 多樣化的任務套件:涵蓋廣泛的能力,包括代理程式程式設計任務(使用 Docker 進行執行)。
  • 靈活的評估流水線:支援 OpenAI 相容的 API、各種模型提供商(Anthropic, Cohere, Mistral 等)以及透過 tmux 進行的並行評估。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案