Hugging Face Judge Arena: 将 LLM 作为评估器进行基准测试
Hugging Face 推出了 Judge Arena,这是一个众包平台,旨在识别出最适合用作评估器的 LLM。该工具解决了确定哪些模型最适合“LLM-as-a-Judge”(LLM 作为裁判)方法的关键需求,即由 AI 模型对其他 AI 应用的自然语言输出进行评分。
众包评估框架
Judge Arena 利用随机的并排对战系统来对 AI 裁判进行基准测试。这种方法基于 LMSys 的 Chatbot Arena 等平台在众包基准测试方面取得的成功。该过程遵循特定的工作流程以确保结果的客观性:
- 样本选择:用户选择一个评估样本,可以通过让系统随机生成“用户输入/AI 响应”对,或者提供自定义样本。
- 双重评估:两个匿名的 LLM 裁判对响应进行评分,并为他们的评分提供详细的推理。
- 人类投票:用户查看评分和评论,并投票给其评估结果最符合自身判断的裁判。
为了防止偏见和滥用,模型身份在投票提交之前保持隐藏。
模型选择标准
Judge Arena 专门关注生成式模型,不包括仅输出分数的分类模型。要被纳入竞技场,模型必须满足两个主要标准:
- 评分与评论能力:模型必须能够有效地对其他模型的输出进行评分并提供评论。
- 提示能力 (Prompt-ability):模型必须能够通过不同的评分格式和标准被提示进行评估。
该平台目前包含来自闭源和开源提供商的 18 个最先进的 LLM,包括:
- OpenAI: GPT-4o, GPT-4 Turbo, GPT-3.5 Turbo
- Anthropic: Claude 3.5 Sonnet / Haiku, Claude 3 Opus / Sonnet / Haiku
- Meta: Llama 3.1 Instruct Turbo (405B, 70B, 8B)
- Alibaba: Qwen 2.5 Instruct Turbo (7B, 72B), Qwen 2 Instruct 72B
- Google: Gemma 2 (9B, 27B)
- Mistral: Instruct v0.3 7B, Instruct v0.1 7B
性能指标与早期洞察
Judge Arena 使用 Elo 等级分系统来计算每个模型的得分,排行榜每小时更新一次。来自该平台的早期观察表明了几个关键趋势:
- 开源模型的竞争力:虽然 GPT-4 Turbo 目前以微弱优势领先,但 Llama 和 Qwen 模型具有极强的竞争力,并超越了大多数闭源模型。
- 小模型的高效性:Qwen 2.5 7B 和 Llama 3.1 8B 展示了令人印象深刻的性能,能够与大得多的模型进行有效竞争。
- 验证了 Llama 作为基座的地位:初步结果显示 Llama 3.1 70B 和 405B 分别排名第 2 和第 3。这与现有的研究(如 Lynx, Auto-J, 和 SFR-LLaMA-3.1-Judge)一致,表明 Llama 模型是评估任务的强大基座模型。
社区贡献与数据共享
为了支持更具一致性的评估器的开发,Hugging Face 和 Atla 已承诺在未来几个月内分享 20% 的匿名投票数据。该平台欢迎社区的反馈以及对排行榜新增模型的建议。