Continuum-AI-Corp/OrcaBonsai-27B-Uncensored
Runtime behavioral ablation for compressed LLMs. First target: Ternary Bonsai 2 27B — no weight modification or re-quantization. by OrcaRouter team
解决的问题
本项目提供了一种方法,可以在不修改原始模型权重的情况下,移除 Ternary Bonsai 2 27B 模型中的拒绝行为(即解除审查)。传统的“abliteration”(消融去审查)通常需要修改权重,这会破坏 Bonsai 模型激进的 1.72 bits/weight 量化。该工具允许模型在推理时改变其行为,同时保持比特级一致且处于压缩状态。
工作原理
该项目没有编辑权重,而是实现了运行时消融。它应用一种投影,移除每个残差贡献中与学习到的“拒绝方向”向量平行的分量。
具体而言,它封装了 129 个残差写入器(包括 MLP 下投影、线性注意力输出投影和嵌入令牌),并在前向传播过程中应用公式 y ← y - α · dot(y, r) · r,其中 α 是干预强度,r 是归一化的拒绝方向。
适用人群
适用于在 Apple Silicon(通过 MLX)或 llama.cpp(使用 rank-1 LoRA 适配器)上使用 Ternary Bonsai 2 27B 模型,并希望减少模型拒绝提示倾向的用户,包括有害和良性的过度拒绝。
亮点
- 零权重修改:原始模型权重保持比特级一致,避免了重新量化错误。
- 运行时控制:消融强度(
alpha)和目标特定层可以在推理期间动态调整。 - 高能力保留:评估显示,消融后模型的通用能力(MMLU、GSM8K)保持稳定。
- 跨平台支持:包括针对 Apple Silicon/MLX 的实现、iOS 的 Swift 参考实现,以及用于 llama.cpp 的 rank-1 LoRA 适配器。
相关
- 项目
- 项目
- 项目
- 项目