Continuum-AI-Corp/OrcaBonsai-27B-Uncensored

Runtime behavioral ablation for compressed LLMs. First target: Ternary Bonsai 2 27B — no weight modification or re-quantization. by OrcaRouter team

解決的問題

本項目提供了一種方法,可以在不修改原始模型權重的情况下,移除 Ternary Bonsai 2 27B 模型中的拒絕行為(即解除審查)。傳統的「abliteration」(消融去審查)通常需要修改權重,這會破壞 Bonsai 模型激進的 1.72 bits/weight 量化。該工具允許模型在推理時改變其行為,同時保持比特級一致且處於壓縮狀態。

工作原理

該項目沒有編輯權重,而是實現了運行時消融。它應用一種投影,移除每個殘差貢獻中與學習到的「拒絕方向」向量平行的分量。

具體而言,它封裝了 129 個殘差寫入器(包括 MLP 下投影、線性注意力輸出投影和嵌入令牌),並在前向傳播過程中應用公式 y ← y - α · dot(y, r) · r,其中 α 是干預強度,r 是歸一化的拒絕方向。

適用人群

適用於在 Apple Silicon(通過 MLX)或 llama.cpp(使用 rank-1 LoRA 適配器)上使用 Ternary Bonsai 2 27B 模型,並希望減少模型拒絕提示傾向的用戶,包括有害和良性的過度拒絕。

亮點

  • 零權重修改:原始模型權重保持比特級一致,避免了重新量化錯誤。
  • 運行時控制:消融強度(alpha)和目標特定層可以在推理期間動態調整。
  • 高能力保留:評估顯示,消融後模型的通用能力(MMLU、GSM8K)保持穩定。
  • 跨平台支持:包括針對 Apple Silicon/MLX 的實現、iOS 的 Swift 參考實現,以及用於 llama.cpp 的 rank-1 LoRA 適配器。

相關