Hugging Face の Artificial Analysis LLM Performance Leaderboard
Hugging Face は Artificial Analysis LLM パフォーマンスリーダーボードを統合し、AI エンジニアに 100 以上のサーバーレス LLM API エンドポイントの品質、価格、速度を比較できる包括的なツールを提供します。この統合により、開発者は応答性とコストを最適化でき、これらは消費者向けアプリケーションやエージェントシステムにおいてモデル精度と同等に重要です。
包括的なパフォーマンス指標
LLM パフォーマンスリーダーボードは、オープンモデルとプロプライエタリモデルの両方を、AI 活用アプリケーションの意思決定を支援するために、次の 3 つの主要次元で評価します。
- Quality: MMLU、MT-Bench、HumanEval スコア(モデル作者が報告したもの)および Chatbot Arena ランキングから導出された簡易指標。
- Price: 入力/出力トークンごとの価格として報告。ホスティングプロバイダー間で直接比較できるよう、入力トークンと出力トークンの比率 3:1 を用いて「ブレンド」価格を算出。
- Speed: 2 つの主要指標で測定:
- Throughput: 推論時のトークン出力速度(トークン/秒 (TPS))で測定。リーダーボードは 14 日間のウィンドウで中央値、P5、P25、P75、P95 の値を報告。
- Latency: 最初のトークンまでの時間 (TTFT) を秒で測定。スループット同様、14 日間で中央値、P5、P25、P75、P95 の複数パーセンタイルで報告。
さらに、リーダーボードは Context Window を追跡し、モデルが同時に処理できる最大トークン数を示します。
テスト手法とワークロード
データの正確性と信頼性を確保するため、Artificial Analysis は厳格なテストスケジュールを採用しています。
- Frequency: すべての API エンドポイントは 1 日に 8 回テストされる。
- Data Window: 数値は過去 14 日間の中央値測定を表す。
- Workload Variations: リーダーボードは、プロンプト長(約 100、約 1k、約 10k トークン)と並列クエリ数(1 クエリ vs. 10 並列クエリ)の 6 通りの組み合わせでパフォーマンスを探索できる。
市場洞察とモデルセグメンテーション(2024年5月)
2024年5月時点で、LLM 市場はパフォーマンスとコストに大きなばらつきがある。Claude 3 Opus のようなハイエンドモデルと Llama 3 8B のような小型モデルの間で、価格差は 300 倍に達する。
モデルは品質の 3 つのセグメントに分類される:
- High Quality (Higher Price/Slower): GPT-4 Turbo と Claude 3 Opus。
- Moderate Quality (Balanced Price/Speed): Llama 3 70B、Mixtral 8x22B、Command R+、Gemini 1.5 Pro、DBRX。
- Lower Quality (Faster/Cheaper): Llama 3 8B、Claude 3 Haiku、Mixtral 8x7B。
戦略的応用:速度、価格、品質のバランス
速度と価格を最適化することで、システム全体の品質が向上する可能性がある。複雑な設計パターンでは、初期処理に小型で高速なモデルを組み合わせ、最終合成に大型モデルを使用する方が、単一の大型モデルに依存するより効果的である。
例えば、ウェブ閲覧チャットボットは Llama 3 8B を使用して多数のウェブページからハイライトを並列に抽出し、レイテンシとコストを削減した後、GPT-4 Turbo で最も関連性の高い結果を要約できる。このアプローチは、コンテンツ量が 10 倍になっても、コスト効率が高く、より高品質な成果をもたらす可能性がある。