p-e-w/heretic
Fully automatic censorship removal for language models
解决的问题
Heretic 可以去除基于 Transformer 的语言模型中的“安全对齐”(审查)。其目标是在尽可能保留原始模型智能和能力的同时,防止模型拒绝回答提示词,从而避免进行此类修改通常所需的昂贵的训练后处理(post-training)。
工作原理
Heretic 使用一种称为方向性消融(directional ablation,或称“abliteration”)的技术。它识别模型隐藏状态中的“残差方向”(residual directions)——即模型处理“有害”提示词与“无害”提示词之间的差异。然后,它对模型的权重矩阵(具体为 attention out-projection 和 MLP down-projection)进行正交化,以抑制这些拒绝方向的表达。
为了使此过程自动化,Heretic 使用基于 TPE 的参数优化器(通过 Optuna)来寻找最佳的消融参数。它在最小化拒绝次数与最小化与原始模型的 KL 散度(KL divergence)之间进行优化,以确保模型不会“损坏”或丧失智能。
适用对象
- LLM 用户: 希望在不需要深入了解 Transformer 内部结构的情况下,获得现有模型无审查版本的人员。
- AI 研究人员: 研究模型可解释性和模型内部语义的人员,因为 Heretic 的
research扩展包提供了用于绘制残差向量和分析残差几何结构的工具。
亮点
- 全自动: 不需要手动调整消融参数;工具会自动寻找最佳设置。
- 广泛支持: 适用于大多数密集模型(dense models)、各种 MoE 架构以及像 Qwen3.5 这样的混合模型。
- 灵活的消融: 使用灵活的权重内核和残差方向的线性插值,以找到比简单的逐层消融更好的方向。
- 可解释性工具: 包括生成 PaCMAP 投影和残差向量动画的功能,以可视化模型内部状态随层变化的转换过程。
相关
- Dispatch
- Dispatch
- 项目
- 项目
- Dispatch