Hugging Face Judge Arena: LLMsを評価者としてベンチマーク

Hugging Faceは、評価者として使用する最も効果的なLLMを特定するために設計されたクラウドソーシングプラットフォームであるJudge Arenaをリリースしました。このツールは、AIモデルが他のAIアプリケーションの自然言語出力を採点する「LLM-as-a-Judge」アプローチに最も適したモデルを決定するという重要なニーズに対応します。

クラウドソーシング評価フレームワーク

Judge Arenaは、AIジャッジをベンチマークするためにランダムなサイドバイサイドバトルシステムを利用しています。この方法論は、LMSysのChatbot Arenaのようなプラットフォームで見られるクラウドソーシングベンチマークの成功に基づいています。このプロセスは、客観的な結果を確保するために特定のワークフローに従います。

  1. サンプル選択: ユーザーは、システムがランダムにUser Input/AI Responseペアを生成するか、カスタムサンプルを提供するかによって、評価用のサンプルを選択します。
  2. デュアル評価: 2人の匿名のLLMジャッジが応答をスコアリングし、詳細な理由を提供します。
  3. 人間による投票: ユーザーはスコアと批評を確認し、自身の判断に最も一致する評価をしたジャッジに投票します。

バイアスと悪用を防ぐため、モデルのアイデンティティは投票が提出されるまで隠されたままになります。

モデル選択基準

Judge Arenaは、スコアのみを出力する分類器モデルを除外し、生成モデルに専念しています。アリーナに含まれるためには、モデルは以下の2つの主要な基準を満たす必要があります。

  • スコアリングと批評能力: モデルは、他のモデルの出力を効果的にスコアリングし、批評を提供できる必要があります。
  • プロンプト能力: モデルは、異なるスコアリングフォーマットと基準を使用して評価するようにプロンプトを与えることができる必要があります。

現在、このプラットフォームには、プロプライエタリおよびオープンソースのプロバイダーからの最先端のLLMが18種類含まれており、以下を含みます:

  • OpenAI: GPT-4o, GPT-4 Turbo, GPT-3.5 Turbo
  • Anthropic: Claude 3.5 Sonnet / Haiku, Claude 3 Opus / Sonnet / Haiku
  • Meta: Llama 3.1 Instruct Turbo (405B, 70B, 8B)
  • Alibaba: Qwen 2.5 Instruct Turbo (7B, 72B), Qwen 2 Instruct 72B
  • Google: Gemma 2 (9B, 27B)
  • Mistral: Instruct v0.3 7B, Instruct v0.1 7B

パフォーマンスメトリクスと初期の洞察

Judge Arenaは、各モデルのスコアを計算するためにElo評価システムを使用しており、リーダーボードは毎時間更新されます。プラットフォームからの初期の観察により、いくつかの重要なトレンドが示されています:

  • オープンソースの競争力: GPT-4 Turboは現在わずかな差でリードしていますが、LlamaとQwenのモデルは非常に競争力が高く、ほとんどのプロプライエタリモデルを上回っています。
  • 小規模モデルの効率性: Qwen 2.5 7BとLlama 3.1 8Bは印象的なパフォーマンスを示しており、はるかに大きなモデルと効果的に競争しています。
  • Llamaをベースとしての検証: 初期の結果では、Llama 3.1 70Bと405Bがそれぞれ2位と3位にランクインしています。これは、Lynx、Auto-J、SFR-LLaMA-3.1-Judgeなどの既存の研究と一致しており、Llamaモデルが評価タスクのための強力なベースモデルであることを示唆しています。

コミュニティへの貢献とデータ共有

より一致した評価者の開発を支援するため、Hugging FaceとAtlaは今後数か月で匿名化された投票データの20%を共有することにコミットしています。このプラットフォームは、リーダーボードに追加する新しいモデルについてのコミュニティからのフィードバックと提案を受け付けています。

Sources