人工分析 LLM 性能排行榜 在 Hugging Face

Hugging Face 已集成 Artificial Analysis LLM Performance Leaderboard,为 AI 工程师提供一个综合工具,用于比较 100 多个无服务器 LLM API 端点的质量、价格和速度。此集成使开发者能够在响应速度和成本之间进行优化,这在面向消费者的应用和代理系统中往往与模型准确性同等重要。

综合性能指标

LLM 性能排行榜在三个主要维度上评估开源和专有模型,以帮助 AI 驱动的应用做出明智决策:

  • 质量: 基于 MMLU、MT-Bench、HumanEval(由模型作者报告的)分数以及 Chatbot Arena 排名的简化指数。
  • 价格: 以输入/输出每 token 的定价方式呈现。为实现不同托管提供商之间的直接比较,使用 3:1 的输入‑输出 token 比例计算“混合”价格。
  • 速度: 通过两个关键指标衡量:
    • 吞吐量(Throughput): 推理期间 token 输出的速度,以每秒 token 数(TPS)计。排行榜在 14 天窗口内报告中位数、P5、P25、P75、P95 等值。
    • 延迟(Latency): 首 token 时间(TTFT),以秒为单位。与吞吐量相同,延迟也在 14 天内按多个百分位(中位数、P5、P25、P75、P95)报告。

此外,排行榜还跟踪 上下文窗口(Context Window),即模型一次性可处理的最大 token 数量。

测试方法与工作负载

为确保数据的准确性和可靠性,Artificial Analysis 采用严格的测试计划:

  • 频率: 每个 API 端点每天测试八次。
  • 数据窗口: 数值代表最近 14 天的中位测量值。
  • 工作负载变化: 排行榜允许用户在六种不同的提示长度组合(约 100、约 1k、约 10k token)以及并行查询量(1 条查询 vs. 10 条并行查询)之间探索性能。

市场洞察与模型分层(2024 年 5 月)

截至 2024 年 5 月,LLM 市场在性能和成本方面呈现显著差异。高端模型如 Claude 3 Opus 与小型模型如 Llama 3 8B 之间的价格差距高达 300 倍。

模型被划分为三类质量层次:

  • 高质量(价格更高/速度更慢): GPT-4 Turbo 与 Claude 3 Opus。
  • 中等质量(价格/速度均衡): Llama 3 70B、Mixtral 8x22B、Command R+、Gemini 1.5 Pro 与 DBRX。
  • 低质量(更快/更便宜): Llama 3 8B、Claude 3 Haiku 与 Mixtral 8x7B。

战略应用:在速度、价格与质量之间取得平衡

在速度和价格上进行优化可以提升整体系统质量。在复杂的设计模式中,先使用更小、更快的模型进行初步处理,再使用更大模型进行最终合成,往往比单纯依赖单一大型模型更有效。

例如,一个网页浏览聊天机器人可以使用 Llama 3 8B 并行提取数十个网页的要点——从而降低延迟和成本——随后使用 GPT-4 Turbo 对最相关的结果进行汇总。即使处理的内容量是原来的十倍,这种方式也更具成本效益,并能产生更高质量的输出。

Sources