tensorflow/tcav

Code for the TCAV ML interpretability project

何を解決するか

TCAV(Concept Activation Vectors を用いたテスト)は、従来の解釈手法が個々の入力特徴(例:ピクセルの重み)に依存するという限界に対処します。個々の入力特徴に基づいて予測を説明するのではなく、TCAV は色、性別、人種などの高レベルな概念が、あるクラス全体のモデル予測にどの程度寄与したかを説明し、人間が理解しやすいグローバルな説明を提供します。

動作方法

TCAV は少量の例(例:ある概念の数枚の画像と、その概念を含まない数枚の画像)から概念を学習します。その後、既存のニューラルネットワークを変更したり再学習したりすることなく、特定の予測クラスにおけるこれらの学習された概念の重要性を計算します。

対象ユーザー

このツールは、ニューラルネットワークが予測に使用する内部信号を理解したいすべての人々向けです。機械学習の専門家でなくても、説明が高レベルな人間の概念で提供されるため、誰もが理解しやすいです。

特徴

  • グローバルな説明:単一の画像ではなく、興味のあるクラス全体に関する洞察を提供します。
  • 概念ベース:生の入力特徴ではなく、高レベルな概念を使用します。
  • 非侵襲的:既存のネットワークを再学習せずに動作します。
  • 柔軟性:画像データだけでなく、離散的で非画像データにも対応可能です。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト