cvs-health/uqlm

[JMLR 2026] "UQLM: A Python Package for Uncertainty Quantification in Large Language Models"

解決的問題

UQLM 旨在透過量化生成回應的不確定性來檢測大語言模型 (LLM) 輸出中的幻覺。它提供了一種為 LLM 輸出分配置信度分數(0 到 1)的標準方法,使用戶能夠識別潛在的錯誤或不可靠資訊。

工作原理

該函式庫實現了多種類別的不確定性量化 (UQ) 技術:

  • Black-Box Scorers: 在不需要存取模型內部的情況下,測量對同一個提示詞生成的多個回應之間的一致性。
  • White-Box Scorers: 使用模型的 Token 機率來估計不確定性;這些方法更快且成本更低,但需要存取模型的內部狀態。
  • LLM-as-a-Judge: 利用一個或多個獨立的 LLM 來評估原始回應的可靠性。
  • Ensemble Scorers: 使用加權平均結合多個單個評分器,可以開箱即用,也可以使用 ground-truth 數據進行微調。
  • Long-Text Scorers: 將長回應分解為單個主張或句子並對每一個進行評分,從而能夠透過移除低置信度主張來優化回應。
  • CodeGenUQ: 一個專門的介面,用於在不執行程式碼的情況下預測生成程式碼的功能正確性。

適用對象

該工具適用於需要監控並減輕 LLM 應用中幻覺的開發人員和 AI 研究人員,特別是那些需要高事實精準度或使用 LangChain 聊天模型的應用。

亮點

  • 廣泛的相容性: 適用於任何 LangChain Chat Model。
  • 多樣化的方法論: 支援廣泛的最先進技術,包括 Semantic Entropy 和 Semantic Density。
  • 細粒度控制: 為長文本提供主張級評分,實現自動化的回應優化。
  • 靈活的權衡: 提供從零成本的白盒評分器到高精度的集成和黑盒方法的各種選項。

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • 專案