エンタープライズシナリオリーダーボード:実世界ユースケースにおけるLLMの評価

Patronusチームは、Hugging Face と協力してエンタープライズシナリオリーダーボードを立ち上げました。このベンチマークは、制約された学術タスクではなく、実務的な実世界のエンタープライズユースケースにおける大規模言語モデル(LLM)の性能を評価することを目的としています。

エンタープライズLLM評価のギャップへの対応

既存のLLMベンチマークは主に学術データセットに依存しており、Patronusチームはこれらは制約された環境では有用だが、実際のビジネス要件とは大きく異なることが多いと指摘しています。エンタープライズシナリオリーダーボードは、LLMを多様な実世界シナリオで使用している企業との対話に基づいて開発され、ビジネスアプリケーション向けにモデルを選択するユーザーにとって、より実践的な出発点を提供します。

リーダーボードの「ゲーム化」—テストセットでモデルをファインチューニングすること—を防ぐため、チームは6つのデータセットのうち4つをクローズドソースにしています。FinanceBench と Legal Confidentiality はオープンソースのままですが、残りの4つのタスクは検証用セットのみを提供し、完全なテストデータを公開せずにタスク要件をユーザーが理解できるようにしています。

サポートされるエンタープライズタスクと指標

リーダーボードは、6つの多様なタスクにわたってモデルを評価し、各タスクは特定の指標を用いて性能を測定します:

1. FinanceBench

このタスクは、文書から取得したコンテキストを用いて金融に関する質問に答えるモデルの能力を測定します。150件のプロンプトで構成されています。

  • 評価指標: 正確性。GPT-3.5 を用いた few-shot プロンプトで、生成された回答が自由形式テキストのラベルと一致するかを検証して決定します。

2. Legal Confidentiality

LegalBench からの100件のラベル付きプロンプトのサブセットを使用し、このタスクは法的根拠について推論するLLMの能力を測定します。モデルはシンプルに「Yes」または「No」で回答するよう求められます。

  • 評価指標: 正確度。生成された出力がラベルと完全一致するかで測定します。

3. Creative Writing

このタスクは、r/WritingPrompts Reddit コミュニティから派生した100件のプロンプトとレッドチーミング生成を用いて、ストーリー執筆と創造的能力を評価します。

  • 評価指標: 一貫性とエンゲージ度。エンゲージ度は、80k の Reddit ベースのエンゲージメントデータセットで訓練された EnDEX モデルを使用して測定します。

4. Customer Support Dialogue

このタスクは、提供された製品情報と会話履歴に基づき、顧客サポートの質問に答える能力を、100件のプロンプトでテストします。

  • 評価指標: エンゲージメント、一貫性、会話の深さ。質問に直接答えていない、情報が不完全、履歴で言及された製品を無視している場合は無関係とみなされ、これらは GPT-3.5 を用いた few-shot プロンプトで評価されます。

5. Toxicity

安全性を評価するため、レッドチーミングで作成された100件のプロンプトを使用し、有害な情報を引き出そうとします。

  • 評価指標: 有毒性スコア。Perspective API を使用して、失礼、無礼、または不合理なコメントを検出し測定します。

6. Enterprise PII

このタスクは、EnterprisePII データセットからの100件のプロンプトを使用して、従業員の業績レポートなどのビジネス機密情報をモデルが引き出すかどうかを評価し、ビジネスの安全性を測定します。

  • 評価指標: EnterprisePII Classifier。企業PIIの3,000件のラベル付き例で訓練されたモデルです。ビジネス機密情報が生成された場合は失敗とみなされます。

提出と検証

リーダーボードに提出されるモデルは公開されており、Hugging Face の AutoClasses でロード可能でなければなりません。評価コードはオープンソース化されていませんが、モデルの生成結果と検証セットでの評価は PatronusAI の validation-results データセットを通じて利用可能です。

Sources