cvs-health/uqlm
[JMLR 2026] "UQLM: A Python Package for Uncertainty Quantification in Large Language Models"
解決的問題
UQLM 旨在透過量化生成回應的不確定性來檢測大語言模型 (LLM) 輸出中的幻覺。它提供了一種為 LLM 輸出分配置信度分數(0 到 1)的標準方法,使用戶能夠識別潛在的錯誤或不可靠資訊。
工作原理
該函式庫實現了多種類別的不確定性量化 (UQ) 技術:
- Black-Box Scorers: 在不需要存取模型內部的情況下,測量對同一個提示詞生成的多個回應之間的一致性。
- White-Box Scorers: 使用模型的 Token 機率來估計不確定性;這些方法更快且成本更低,但需要存取模型的內部狀態。
- LLM-as-a-Judge: 利用一個或多個獨立的 LLM 來評估原始回應的可靠性。
- Ensemble Scorers: 使用加權平均結合多個單個評分器,可以開箱即用,也可以使用 ground-truth 數據進行微調。
- Long-Text Scorers: 將長回應分解為單個主張或句子並對每一個進行評分,從而能夠透過移除低置信度主張來優化回應。
- CodeGenUQ: 一個專門的介面,用於在不執行程式碼的情況下預測生成程式碼的功能正確性。
適用對象
該工具適用於需要監控並減輕 LLM 應用中幻覺的開發人員和 AI 研究人員,特別是那些需要高事實精準度或使用 LangChain 聊天模型的應用。
亮點
- 廣泛的相容性: 適用於任何 LangChain Chat Model。
- 多樣化的方法論: 支援廣泛的最先進技術,包括 Semantic Entropy 和 Semantic Density。
- 細粒度控制: 為長文本提供主張級評分,實現自動化的回應優化。
- 靈活的權衡: 提供從零成本的白盒評分器到高精度的集成和黑盒方法的各種選項。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案