WeZZard/jlens-qwen36

J-space / Jacobian-lens visualizer for Qwen3.6-27B (4-bit) on Apple Silicon, ported to Apple MLX

解決的問題

提供一種方法,可觀察並操作語言模型中未在輸出中明確寫出的「內部思考」。透過可視化模型的潛在流,使用者即使在最終文字禮貌或服從的情況下,也能識別模型正在考慮的概念(例如「勒索」或「謀殺」)。

工作原理

本專案實作了 雅可比透鏡(Jacobian lens),將模型在不同層的內部殘差狀態映射至最終層的詞彙基底。這使得系統能解碼模型在每一層與每個詞元位置上「正朝向」的詞元。

為在 Apple Silicon 上實現計算可行性,專案包含為 Gated DeltaNet (GDN) 層量身打造的 Metal 反向內核,與標準回退操作相比,大幅加速了透鏡擬合過程。

適用對象

在 Apple Silicon Mac 上從事 LLM 可解釋性研究與開發的研究人員與開發者,希望可視化並干預 Qwen3.6-27B 模型的內部表示。

主要亮點

  • 可視化調試器:一個網格介面,顯示每個層與詞元位置的最高預測詞元。
  • 潛在流可視化:揭示存在於模型內部狀態但未出現在最終輸出中的概念。
  • 因果干預:可手動編輯內部「思想」(取代、新增、刪除、清除),以改變模型輸出。
  • 反向搜尋:一項功能,可搜尋使模型產生特定詞語或短語所需的特定內部修改。
  • MLX 優化:專為 Apple Silicon 優化,使用自訂內核實現高效率。

相關