使用 LLM 作為評判者評估 RAG

Mistral AI 推出了使用「LLM 作為評判者」方法評估檢索增強生成(RAG)系統的框架。此方法可讓開發者透過評判 LLM 根據特定、機器可讀的標準來評分生成 LLM 的輸出,從而實現評估的擴展。

使用 LLM 作為評判者進行可擴展評估

當無法取得人類評判者時,LLM 作為評判者是一種可擴展評估 LLM 系統的解決方案。在此架構中,會指示「評判 LLM」根據預定的評分標準來評分「生成 LLM」的回應,評分標準可以是數值型(例如 0-3 或 1-10)、二元型(True/False),或質性描述(例如「優秀」到「差」)。

要實現此方法,開發者需建立自訂的指令提示(prompt),定義評分標準,例如回應是否準確、相關或有根據。Mistral 的模型可作為此類系統中生成與評判兩部分的元件。

RAG 三元組評估框架

為了超越簡單的連貫性檢查,Mistral 建議使用 RAG 三元組(RAG Triad)框架。此框架由 TruLens 提出,與 RAGAS 相似,是一種全面性的評估方法,用於評估 RAG 系統的可靠性與上下文完整性。RAG 三元組評估三個特定指標:

1. 上下文相關性

上下文相關性衡量所檢索的文件是否與使用者的查詢相符。這確保提供給生成 LLM 的資訊是適當且足夠的,以產生有用的回應。

2. 有根據性

有根據性驗證生成的回應是否準確地基於所檢索的上下文。此指標對於減少幻覺至關重要,確保輸出內容真實且忠於原始資料。

3. 回應相關性

回應相關性評估最終回應與使用者原始查詢的契合程度,確保輸出符合使用者意圖並提供有價值的洞察。

使用結構化輸出實現評估

Mistral AI 利用其「結構化輸出」API 功能,使 LLM 作為評判者的過程更具可靠性與機器可讀性。透過強制評判者的回應遵循特定資料結構,開發者可確保評估結果一致且易於程式化處理。

使用 Pydantic 模型,Mistral 示範如何定義一個 RAGEvaluation 資料結構,要求評判 LLM 提供針對三元組指標(上下文相關性、回應相關性、有根據性)的逐步推理說明與評分。

結論

結合 RAG 三元組框架與結構化輸出,可實現對 RAG 系統的強大、端到端評估。此方法同時評估檢索與生成步驟,確保人類、AI 與知識庫之間的最終互動準確且值得信賴。

Sources

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案