UKGovernmentBEIS/inspect_ai

Inspect: A framework for large language model evaluations

解決的問題

Inspect 是一個專為評估大型語言模型(LLM)而設計的框架。它提供了一種標準化的方式來測試模型,確保其按預期運作,並識別潛在的安全或效能缺口。

運作方式

它作為一個評估框架,內建了提示工程、多輪對話和工具使用元件。同時支援模型評分評估,即使用一個模型來評分另一個模型的表現。系統具備可擴展性,允許其他 Python 套件提供新的評分技術或引導方法。

適用對象

此工具主要針對需要嚴格測試與評估大型語言模型能力的 AI 研究人員、安全稽核人員和開發者。

主要亮點

  • 超過 200 個預建評估,可直接在任何模型上執行。
  • 支援多輪對話與工具使用測試。
  • 支援模型評分評估。
  • 透過 Python 套件實現可擴展架構。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案