EleutherAI/lm-evaluation-harness
A framework for few-shot evaluation of language models.
解決的問題
本專案提供了一個統一的框架,用於在各種評估任務中測試生成式語言模型。它消除了為不同模型執行單獨、零散基準測試的需求,讓研究人員和開發人員能夠使用標準學術基準,一致且可重現地比較 LLM 的效能。
運作方式
此測試工具作為各種模型後端和評估任務庫之間的標準化介面。它支援多種模型載入方式,包括 Hugging Face transformers、vLLM、NVIDIA NeMo、Megatron-LM 和商業 API(如 OpenAI)。該框架允許使用者透過 CLI 或 Python API 指定模型、一組任務(例如 hellaswag)和設定選項,然後自動處理提示詞生成、模型推論和指標計算。
適用對象
它專為 AI 研究人員、LLM 開發人員和組織(例如 NVIDIA、Cohere 和 Mosaic ML)設計,這些使用者需要根據業界標準基準嚴格評估其模型的能力,以確保可比較性以及與 Open LLM Leaderboard 的一致性。
亮點
- 廣泛的基準庫:包含超過 60 個標準學術基準和數百個子任務。
- 廣泛的模型支援:與 Hugging Face、vLLM、Megatron-DeepSpeed、NVIDIA NeMo 和商業 API 相容。
- 靈活的並行性:支援資料並行評估、模型分片(透過
accelerate)和原生 PyTorch Tensor Parallelism。 - 可自訂性:允許自訂提示詞、評估指標和基於 YAML 的任務設定。
- 多模態原型設計:對文字+影像多模態輸入任務提供實驗性支援。
- 業界標準:作為 Hugging Face Open LLM Leaderboard 的後端。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案