Hugging Face の Artificial Analysis LLM Performance Leaderboard

Hugging Face は Artificial Analysis LLM パフォーマンスリーダーボードを統合し、AI エンジニアに 100 以上のサーバーレス LLM API エンドポイントの品質、価格、速度を比較できる包括的なツールを提供します。この統合により、開発者は応答性とコストを最適化でき、これらは消費者向けアプリケーションやエージェントシステムにおいてモデル精度と同等に重要です。

包括的なパフォーマンス指標

LLM パフォーマンスリーダーボードは、オープンモデルとプロプライエタリモデルの両方を、AI 活用アプリケーションの意思決定を支援するために、次の 3 つの主要次元で評価します。

  • Quality: MMLU、MT-Bench、HumanEval スコア(モデル作者が報告したもの)および Chatbot Arena ランキングから導出された簡易指標。
  • Price: 入力/出力トークンごとの価格として報告。ホスティングプロバイダー間で直接比較できるよう、入力トークンと出力トークンの比率 3:1 を用いて「ブレンド」価格を算出。
  • Speed: 2 つの主要指標で測定:
    • Throughput: 推論時のトークン出力速度(トークン/秒 (TPS))で測定。リーダーボードは 14 日間のウィンドウで中央値、P5、P25、P75、P95 の値を報告。
    • Latency: 最初のトークンまでの時間 (TTFT) を秒で測定。スループット同様、14 日間で中央値、P5、P25、P75、P95 の複数パーセンタイルで報告。

さらに、リーダーボードは Context Window を追跡し、モデルが同時に処理できる最大トークン数を示します。

テスト手法とワークロード

データの正確性と信頼性を確保するため、Artificial Analysis は厳格なテストスケジュールを採用しています。

  • Frequency: すべての API エンドポイントは 1 日に 8 回テストされる。
  • Data Window: 数値は過去 14 日間の中央値測定を表す。
  • Workload Variations: リーダーボードは、プロンプト長(約 100、約 1k、約 10k トークン)と並列クエリ数(1 クエリ vs. 10 並列クエリ)の 6 通りの組み合わせでパフォーマンスを探索できる。

市場洞察とモデルセグメンテーション(2024年5月)

2024年5月時点で、LLM 市場はパフォーマンスとコストに大きなばらつきがある。Claude 3 Opus のようなハイエンドモデルと Llama 3 8B のような小型モデルの間で、価格差は 300 倍に達する。

モデルは品質の 3 つのセグメントに分類される:

  • High Quality (Higher Price/Slower): GPT-4 Turbo と Claude 3 Opus。
  • Moderate Quality (Balanced Price/Speed): Llama 3 70B、Mixtral 8x22B、Command R+、Gemini 1.5 Pro、DBRX。
  • Lower Quality (Faster/Cheaper): Llama 3 8B、Claude 3 Haiku、Mixtral 8x7B。

戦略的応用:速度、価格、品質のバランス

速度と価格を最適化することで、システム全体の品質が向上する可能性がある。複雑な設計パターンでは、初期処理に小型で高速なモデルを組み合わせ、最終合成に大型モデルを使用する方が、単一の大型モデルに依存するより効果的である。

例えば、ウェブ閲覧チャットボットは Llama 3 8B を使用して多数のウェブページからハイライトを並列に抽出し、レイテンシとコストを削減した後、GPT-4 Turbo で最も関連性の高い結果を要約できる。このアプローチは、コンテンツ量が 10 倍になっても、コスト効率が高く、より高品質な成果をもたらす可能性がある。

Sources