cvs-health/uqlm

[JMLR 2026] "UQLM: A Python Package for Uncertainty Quantification in Large Language Models"

解決する課題

UQLMは、生成された回答の不確実性を定量化することで、大規模言語モデル(LLM)の出力におけるハルシネーションを検出するように設計されています。LLMの出力に信頼度スコア(0から1)を割り当てる標準化された方法を提供し、ユーザーが誤っている可能性のある情報や信頼できない情報を特定できるようにします。

仕組み

このライブラリは、いくつかのカテゴリの不確実性定量化(UQ)技術を実装しています:

  • Black-Box Scorers: モデルの内部アクセスを必要とせず、同じプロンプトに対する複数の生成回答の一貫性を測定します。
  • White-Box Scorers: モデルのトークン確率を使用して不確実性を推定します。これらは高速で低コストですが、モデルの内部状態へのアクセスが必要です。
  • LLM-as-a-Judge: 1つまたは複数の別のLLMを使用して、元の回答の信頼性を評価します。
  • Ensemble Scorers: 加重平均を使用して複数の個別のスコアラーを組み合わせます。これはそのまま使用することも、グランドトゥルースデータを使用して調整することも可能です。
  • Long-Text Scorers: 長い回答を個々の主張や文章に分解してそれぞれをスコア化し、信頼度の低い主張を削除して回答を洗練させることを可能にします。
  • CodeGenUQ: 生成されたコードを実行することなく、その機能的な正確性を予測するための専用インターフェースです。

対象ユーザー

このツールは、LLMアプリケーションにおけるハルシネーションを監視および軽減する必要がある開発者やAI研究者、特に高い事実精度を必要とするアプリケーションやLangChainチャットモデルを使用しているユーザー向けです。

ハイライト

  • 幅広い互換性: すべてのLangChain Chat Modelに対応しています。
  • 多様な手法: Semantic EntropyやSemantic Densityを含む、幅広い最先端技術をサポートしています。
  • きめ細かな制御: 長文テキストに対して主張レベルのスコアリングを提供し、自動的な回答の洗練を可能にします。
  • 柔軟なトレードオフ: ゼロコストのホワイトボックススコアラーから、高精度なアンサンブルおよびブラックボックス手法まで、さまざまなオプションを提供します。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト