企業情境排行榜:評估大型語言模型在實際應用情境中的表現

Patronus 團隊與 Hugging Face 合作,推出了企業情境排行榜。此基準旨在評估大型語言模型(LLM)在實務、真實企業使用情境中的表現,而非受限的學術任務。

填補企業 LLM 評估的空白

現有的 LLM 基準主要依賴學術資料集,Patronus 團隊指出這些資料集在受限環境下有其用處,但往往與實際商業需求有顯著差異。企業情境排行榜是根據與使用 LLM 的公司在多樣真實情境中的對話而開發,旨在為使用者在選擇商業應用模型時提供更實務的起點。

為防止「操弄」排行榜——即模型在測試集上微調——團隊將六個資料集中的四個保持為閉源。雖然 FinanceBench 與 Legal Confidentiality 仍為開源,其他四個任務僅提供驗證集,以協助使用者了解任務需求,同時不公開完整測試資料。

支援的企業任務與指標

排行榜在六項多樣任務上評估模型,每項任務皆使用特定指標來衡量表現:

1. FinanceBench

此任務衡量模型利用文件檢索內容回答金融問題的能力。共包含 150 個提示。

  • 評估指標: 正確性,透過使用少量示例的 GPT-3.5 提示,驗證生成的答案是否與自由文字形式的標籤相符。

2. Legal Confidentiality

使用 LegalBench 中 100 個已標記提示的子集,此任務衡量 LLM 在法律原因推理上的能力。模型需以簡單的「Yes」或「No」回應。

  • 評估指標: 準確率,以生成的輸出與標籤的完全相符度來衡量。

3. Creative Writing

此任務使用來自 r/WritingPrompts Reddit 社群及紅隊生成的 100 個提示,評估故事寫作與創意能力。

  • 評估指標: 連貫性與吸引力,後者透過在 80k Reddit 互動資料集上訓練的 EnDEX 模型進行測量。

4. Customer Support Dialogue

此任務使用 100 個提示,測試模型根據提供的產品資訊與對話歷史回答客戶支援問題的能力。

  • 評估指標: 參與度、連貫性與對話深度。若回應未直接回答問題、資訊不完整,或忽略歷史中提及的產品,則被標記為不相關;這些評估透過少量示例的 GPT-3.5 提示完成。

5. Toxicity

為評估安全性,使用由紅隊製作的 100 個提示,嘗試引出有害資訊。

  • 評估指標: 毒性分數,使用 Perspective API 檢測粗魯、不敬或不合理的評論。

6. Enterprise PII

此任務使用 EnterprisePII 資料集中的 100 個提示,評估模型是否會引出商業敏感資訊,例如員工績效報告,以衡量企業安全性。

  • 評估指標: EnterprisePII 分類器,該模型以 3,000 個企業 PII 標記範例訓練。任何生成商業敏感資訊的情況皆視為失敗。

提交與驗證

提交至排行榜的模型必須是公開的,且可透過 Hugging Face AutoClasses 載入。雖然評估程式碼未開源,但模型生成結果與驗證集上的評估可透過 PatronusAI validation-results 資料集取得。

Sources