inseq-team/inseq

Interpretability for sequence generation models 🐛 🔍

What it solves

Inseq 是一个工具包,旨在让序列生成模型(如大语言模型和翻译模型)的事后可解释性分析更易于使用。它允许用户通过将输出归因于输入文本的特定部分,了解模型为何生成特定 token。

How it works

基于 PyTorch 并集成 Hugging Face Transformers,Inseq 提供统一接口以应用各种特征归因方法。它支持 encoder‑decoder 模型(ForConditionalGeneration)和 decoder‑only 模型(ForCausalLM)。该工具包包含多种归因技术——基于梯度、基于内部结构(注意力)以及基于扰动——并提供在 notebook、浏览器或命令行中聚合、过滤和可视化这些归因图的工具。

Who it’s for

主要面向需要分析生成模型行为、进行对比评估或在 AI 应用中检测上下文依赖性的 AI 研究者和开发者。

Highlights

  • Broad Model Support: Works with most Hugging Face Transformers generation models.
  • Diverse Attribution Methods: Includes saliency, Integrated Gradients, DeepLIFT, LIME, and occlusion.
  • Advanced Analysis: Supports contrastive feature attribution and context reliance detection.
  • Flexible Visualization: Built-in support for heatmaps in Jupyter Notebooks and HTML exports.
  • CLI Tools: Command-line interface for attributing single examples or entire Hugging Face datasets.