inseq-team/inseq
Interpretability for sequence generation models 🐛 🔍
What it solves
Inseq は、シーケンス生成モデル(LLM や翻訳モデルなど)の事後解釈性分析をより手軽にするために設計されたツールキットです。出力トークンを入力テキストの特定部分に帰属させることで、モデルがなぜそのトークンを生成したのかを理解できます。
How it works
PyTorch 上に構築され、Hugging Face Transformers と統合された Inseq は、さまざまな特徴帰属手法を適用するための統一インターフェースを提供します。エンコーダ‑デコーダモデル(ForConditionalGeneration)とデコーダのみモデル(ForCausalLM)の両方をサポートします。ツールキットには、勾配ベース、内部構造ベース(アテンション)、摂動ベースの多様な帰属手法が含まれ、ノートブック、ブラウザ、コマンドライン上で帰属マップを集約、フィルタリング、可視化するツールが提供されます。
Who it’s for
主に、生成モデルの挙動を分析したり、対照的評価を行ったり、AI アプリケーションにおけるコンテキスト依存性を検出したりする必要がある AI 研究者や開発者を対象としています。
Highlights
- Broad Model Support: Works with most Hugging Face Transformers generation models.
- Diverse Attribution Methods: Includes saliency, Integrated Gradients, DeepLIFT, LIME, and occlusion.
- Advanced Analysis: Supports contrastive feature attribution and context reliance detection.
- Flexible Visualization: Built-in support for heatmaps in Jupyter Notebooks and HTML exports.
- CLI Tools: Command-line interface for attributing single examples or entire Hugging Face datasets.