人工分析 LLM 性能排行榜於 Hugging Face

Hugging Face 已整合人工分析 LLM 性能排行榜,為 AI 工程師提供一個全面的工具,以比較超過 100 個無伺服器 LLM API 端點的品質、價格與速度。此整合讓開發者能在回應速度與成本之間取得最佳化,這在消費者應用與代理系統中往往與模型準確度同等重要。

綜合性能指標

LLM 性能排行榜在三個主要維度上評估開放與專有模型,協助 AI 應用做出明智決策:

  • 品質: 由 MMLU、MT-Bench、HumanEval 分數(由模型作者報告)以及 Chatbot Arena 排名衍生的簡化指標。
  • 價格: 以每個 token 的輸入/輸出價格報告。為了在不同託管服務商之間直接比較,使用 3:1 輸入對輸出 token 比率計算「混合」價格。
  • 速度: 透過兩個關鍵指標測量:
    • 吞吐量: 推論期間 token 輸出的速度,以每秒 token 數 (TPS) 計算。排行榜在 14 天窗口內報告中位數、P5、P25、P75、P95 值。
    • 延遲: 首個 token 的時間 (TTFT),以秒為單位。與吞吐量相同,此指標在 14 天內以多個百分位(中位數、P5、P25、P75、P95)報告。

此外,排行榜會追蹤 上下文窗口,即模型一次可同時處理的最大 token 數量。

測試方法與工作負載

為確保資料的準確性與可靠性,人工分析採用嚴謹的測試排程:

  • 頻率: 每個 API 端點每日測試八次。
  • 資料窗口: 數據代表最近 14 天的中位測量值。
  • 工作負載變化: 排行榜允許使用者探索六種不同的提示長度(約 100、約 1k、約 10k token)與平行查詢量(1 個查詢 vs. 10 個平行查詢)的性能組合。

市場洞察與模型分層(2024 年 5 月)

截至 2024 年 5 月,LLM 市場在性能與成本上呈現顯著差異。高階模型如 Claude 3 Opus 與較小模型如 Llama 3 8B 之間的價格差距高達 300 倍。

模型依品質分為三個層級:

  • 高品質(價格較高/較慢): GPT-4 Turbo 與 Claude 3 Opus。
  • 中等品質(價格/速度均衡): Llama 3 70B、Mixtral 8x22B、Command R+、Gemini 1.5 Pro 與 DBRX。
  • 低品質(較快/較便宜): Llama 3 8B、Claude 3 Haiku 與 Mixtral 8x7B。

策略應用:平衡速度、價格與品質

優化速度與價格可提升整體系統品質。在複雜的設計模式中,結合較小且較快的模型進行初始處理,與較大型模型進行最終合成,往往比僅依賴單一大型模型更有效。

例如,網頁瀏覽聊天機器人可以使用 Llama 3 8B 以平行方式從數十個網頁中提取重點——降低延遲與成本——然後使用 GPT-4 Turbo 彙總最相關的結果。即使處理十倍以上的內容,此方法亦能更具成本效益,且產生更高品質的結果。

Sources