Continuum-AI-Corp/OrcaBonsai-27B-Uncensored
Runtime behavioral ablation for compressed LLMs. First target: Ternary Bonsai 2 27B — no weight modification or re-quantization. by OrcaRouter team
解決的問題
本項目提供了一種方法,可以在不修改原始模型權重的情况下,移除 Ternary Bonsai 2 27B 模型中的拒絕行為(即解除審查)。傳統的「abliteration」(消融去審查)通常需要修改權重,這會破壞 Bonsai 模型激進的 1.72 bits/weight 量化。該工具允許模型在推理時改變其行為,同時保持比特級一致且處於壓縮狀態。
工作原理
該項目沒有編輯權重,而是實現了運行時消融。它應用一種投影,移除每個殘差貢獻中與學習到的「拒絕方向」向量平行的分量。
具體而言,它封裝了 129 個殘差寫入器(包括 MLP 下投影、線性注意力輸出投影和嵌入令牌),並在前向傳播過程中應用公式 y ← y - α · dot(y, r) · r,其中 α 是干預強度,r 是歸一化的拒絕方向。
適用人群
適用於在 Apple Silicon(通過 MLX)或 llama.cpp(使用 rank-1 LoRA 適配器)上使用 Ternary Bonsai 2 27B 模型,並希望減少模型拒絕提示傾向的用戶,包括有害和良性的過度拒絕。
亮點
- 零權重修改:原始模型權重保持比特級一致,避免了重新量化錯誤。
- 運行時控制:消融強度(
alpha)和目標特定層可以在推理期間動態調整。 - 高能力保留:評估顯示,消融後模型的通用能力(MMLU、GSM8K)保持穩定。
- 跨平台支持:包括針對 Apple Silicon/MLX 的實現、iOS 的 Swift 參考實現,以及用於 llama.cpp 的 rank-1 LoRA 適配器。
相關
- 專案
- 專案
- 專案
- 專案