p-e-w/heretic
Fully automatic censorship removal for language models
解決する課題
Hereticは、Transformerベースの言語モデルから「セーフティ・アライメント」(検閲)を取り除きます。このツールの目的は、モデルがプロンプトへの回答を拒否するのを防ぎつつ、元のモデルの知能と能力を最大限に維持することであり、このような修正に通常必要とされる高コストなポストトレーニングを回避することを目指しています。
仕組み
Hereticは、方向性アブレーション(または「アブリレーション」)と呼ばれる手法を使用します。これは、モデルの隠れ状態における「残差方向」、つまりモデルが「有害な」プロンプトを処理する場合と「無害な」プロンプトを処理する場合の差を特定するものです。その後、モデルの重み行列(具体的には attention out-projection と MLP down-projection)を直交化し、それらの拒否方向の発現を抑制します。
このプロセスを自動化するために、Hereticは TPE ベースのパラメータ最適化手法(Optuna を使用)を用いて最適なアブレーション・パラメータを見つけ出します。拒否の最小化と、元のモデルからの KL ダイバージェンスの最小化のバランスを最適化することで、モデルが「壊れた」状態になったり知能を失ったりしないようにします。
対象者
- LLM ユーザー: Transformer の内部構造に関する深い知識を必要とせずに、既存モデルの検閲なしバージョンを求める人々。
- AI 研究者: モデルの解釈可能性や内部セマンティクスを研究している人々。Heretic の
researchエクストラは、残差ベクトルのプロットや残差幾何学の分析のためのツールを提供します。
ハイライト
- 完全自動化: アブレーション・パラメータの手動調整は不要です。ツールが最適な設定を自動的に見つけます。
- 幅広いサポート: ほとんどの Dense モデル、さまざまな MoE アーキテクチャ、および Qwen3.5 のようなハイブリッドモデルに対応しています。
- 柔軟なアブレーション: 柔軟な重みカーネルと残差方向の線形補間を使用し、単純なレイヤーごとのアブレーションよりも優れた方向を見つけ出します。
- 解釈可能性ツール: モデルの内部状態がレイヤーを越えてどのように変化するかを可視化するために、PaCMAP プロジェクションや残差ベクトルのアニメーションを生成する機能が含まれています。
関連
- Dispatch
- Dispatch
- プロジェクト
- プロジェクト
- Dispatch