Continuum-AI-Corp/OrcaBonsai-27B-Uncensored

Runtime behavioral ablation for compressed LLMs. First target: Ternary Bonsai 2 27B — no weight modification or re-quantization. by OrcaRouter team

解決する問題

このプロジェクトは、元のモデルの重みを修正することなく、Ternary Bonsai 2 27B モデルからの拒否行動(検閲解除)を除去する方法を提供します。従来の「abliteration(アブリテレーション)」は通常、重みの修正を必要とし、これは Bonsai モデルの激しい 1.72 bits/weight 量子化を破壊してしまいます。このツールにより、モデルはビット単位で同一かつ圧縮された状態を維持しながら、推論時の動作を変更できます。

仕組み

重みを編集する代わりに、このプロジェクトはランタイムアブレーションを実装しています。学習された「拒否方向」ベクトルに平行な、各残差寄与の成分を除去する射影を適用します。

具体的には、129個の残差ライター(MLPダウンプロジェクション、線形アテンション出力プロジェクション、埋め込みトークンを含む)をラップし、フォワードパス中に y ← y - α · dot(y, r) · r という式を適用します。ここで α は介入強度、r は正規化された拒否方向です。

対象ユーザー

Apple Silicon(MLX経由)または llama.cpp(rank-1 LoRA アダプター使用)上で Ternary Bonsai 2 27B モデルを使用し、有害な過剰拒否と無害な過剰拒否の両方を含む、モデルのプロンプト拒否傾向を軽減したいユーザー向けです。

ハイライト

  • 重みの修正ゼロ: 元のモデルの重みはビット単位で同一のままであり、再量子化エラーを回避します。
  • ランタイム制御: アブレーション強度(alpha)と対象とする特定のレイヤーは、推論中に動的に調整できます。
  • 高い能力維持: 評価によると、アブレーション後もモデルの一般的な能力(MMLU、GSM8K)は安定しています。
  • クロスプラットフォーム対応: Apple Silicon/MLX 向けの実装、iOS 向けの Swift リファレンス、llama.cpp 向けの rank-1 LoRA アダプターが含まれています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト