企業情境排行榜:評估大型語言模型在實際應用情境中的表現
Patronus 團隊與 Hugging Face 合作,推出了企業情境排行榜。此基準旨在評估大型語言模型(LLM)在實務、真實企業使用情境中的表現,而非受限的學術任務。
填補企業 LLM 評估的空白
現有的 LLM 基準主要依賴學術資料集,Patronus 團隊指出這些資料集在受限環境下有其用處,但往往與實際商業需求有顯著差異。企業情境排行榜是根據與使用 LLM 的公司在多樣真實情境中的對話而開發,旨在為使用者在選擇商業應用模型時提供更實務的起點。
為防止「操弄」排行榜——即模型在測試集上微調——團隊將六個資料集中的四個保持為閉源。雖然 FinanceBench 與 Legal Confidentiality 仍為開源,其他四個任務僅提供驗證集,以協助使用者了解任務需求,同時不公開完整測試資料。
支援的企業任務與指標
排行榜在六項多樣任務上評估模型,每項任務皆使用特定指標來衡量表現:
1. FinanceBench
此任務衡量模型利用文件檢索內容回答金融問題的能力。共包含 150 個提示。
- 評估指標: 正確性,透過使用少量示例的 GPT-3.5 提示,驗證生成的答案是否與自由文字形式的標籤相符。
2. Legal Confidentiality
使用 LegalBench 中 100 個已標記提示的子集,此任務衡量 LLM 在法律原因推理上的能力。模型需以簡單的「Yes」或「No」回應。
- 評估指標: 準確率,以生成的輸出與標籤的完全相符度來衡量。
3. Creative Writing
此任務使用來自 r/WritingPrompts Reddit 社群及紅隊生成的 100 個提示,評估故事寫作與創意能力。
- 評估指標: 連貫性與吸引力,後者透過在 80k Reddit 互動資料集上訓練的 EnDEX 模型進行測量。
4. Customer Support Dialogue
此任務使用 100 個提示,測試模型根據提供的產品資訊與對話歷史回答客戶支援問題的能力。
- 評估指標: 參與度、連貫性與對話深度。若回應未直接回答問題、資訊不完整,或忽略歷史中提及的產品,則被標記為不相關;這些評估透過少量示例的 GPT-3.5 提示完成。
5. Toxicity
為評估安全性,使用由紅隊製作的 100 個提示,嘗試引出有害資訊。
- 評估指標: 毒性分數,使用 Perspective API 檢測粗魯、不敬或不合理的評論。
6. Enterprise PII
此任務使用 EnterprisePII 資料集中的 100 個提示,評估模型是否會引出商業敏感資訊,例如員工績效報告,以衡量企業安全性。
- 評估指標: EnterprisePII 分類器,該模型以 3,000 個企業 PII 標記範例訓練。任何生成商業敏感資訊的情況皆視為失敗。
提交與驗證
提交至排行榜的模型必須是公開的,且可透過 Hugging Face AutoClasses 載入。雖然評估程式碼未開源,但模型生成結果與驗證集上的評估可透過 PatronusAI validation-results 資料集取得。