UKGovernmentBEIS/inspect_ai
Inspect: A framework for large language model evaluations
解決的問題
Inspect 是一個專為評估大型語言模型(LLM)而設計的框架。它提供了一種標準化的方式來測試模型,確保其按預期運作,並識別潛在的安全或效能缺口。
運作方式
它作為一個評估框架,內建了提示工程、多輪對話和工具使用元件。同時支援模型評分評估,即使用一個模型來評分另一個模型的表現。系統具備可擴展性,允許其他 Python 套件提供新的評分技術或引導方法。
適用對象
此工具主要針對需要嚴格測試與評估大型語言模型能力的 AI 研究人員、安全稽核人員和開發者。
主要亮點
- 超過 200 個預建評估,可直接在任何模型上執行。
- 支援多輪對話與工具使用測試。
- 支援模型評分評估。
- 透過 Python 套件實現可擴展架構。
相關
- 專案
- 專案
- 專案
- 專案
- 專案