p-e-w/heretic

Fully automatic censorship removal for language models

解決的問題

Heretic 可以移除基於 Transformer 的語言模型中的「安全對齊」(審查)。其目標是在盡可能保留原始模型智能與能力的同時,防止模型拒絕回答提示詞,從而避免進行此類修改通常所需的昂貴訓練後處理(post-training)。

工作原理

Heretic 使用一種稱為方向性消融(directional ablation,或稱「abliteration」)的技術。它識別模型隱藏狀態中的「殘差方向」(residual directions)——即模型處理「有害」提示詞與「無害」提示詞之間的差異。接著,它對模型的權重矩陣(具體為 attention out-projection 與 MLP down-projection)進行正交化,以抑制這些拒絕方向的表達。

為了使此過程自動化,Heretic 使用基於 TPE 的參數優化器(透過 Optuna)來尋找最佳的消融參數。它在最小化拒絕次數與最小化與原始模型的 KL 散度(KL divergence)之間進行優化,以確保模型不會「損壞」或喪失智能。

適用對象

  • LLM 使用者: 希望在不需要深入了解 Transformer 內部結構的情況下,獲得現有模型無審查版本的人員。
  • AI 研究人員: 研究模型可解釋性與模型內部語義的人員,因為 Heretic 的 research 擴充功能提供了用於繪製殘差向量與分析殘差幾何結構的工具。

亮點

  • 全自動: 不需要手動調整消融參數;工具會自動尋找最佳設定。
  • 廣泛支援: 適用於大多數密集模型(dense models)、各種 MoE 架構以及像 Qwen3.5 這樣的混合模型。
  • 靈活的消融: 使用靈活的權重核心與殘差方向的線性插值,以找到比簡單的逐層消融更好的方向。
  • 可解釋性工具: 包括生成 PaCMAP 投影與殘差向量動畫的功能,以視覺化模型內部狀態隨層變化的轉換過程。

相關

  • Dispatch
  • Dispatch
  • 專案
  • 專案
  • Dispatch