WeZZard/jlens-qwen36
J-space / Jacobian-lens visualizer for Qwen3.6-27B (4-bit) on Apple Silicon, ported to Apple MLX
解决的问题
提供一种方法,可以观察和操作语言模型中未在输出中明确写出的「内部思考」。通过可视化模型的潜在流,用户即使在最终文本礼貌或顺从的情况下,也能识别模型正在考虑的概念(例如「勒索」或「谋杀」)。
工作原理
该项目实现了 雅可比透镜(Jacobian lens),将模型在不同层的内部残差状态映射到最终层的词汇基底。这使得系统能够解码模型在每一层和每个词元位置上「正趋向」的词元。
为了在 Apple Silicon 上实现计算可行性,项目包含一个为 Gated DeltaNet (GDN) 层定制的 Metal 反向内核,与标准回退操作相比,显著加快了透镜拟合过程。
适用人群
在 Apple Silicon Mac 上从事 LLM 可解释性研究和开发的研究人员和开发者,希望可视化并干预 Qwen3.6-27B 模型的内部表示。
主要亮点
- 可视化调试器:一个网格界面,显示每个层和词元位置的最高预测词元。
- 潜在流可视化:揭示存在于模型内部状态但未出现在最终输出中的概念。
- 因果干预:能够手动编辑内部「思想」(替换、添加、删除、擦除),以改变模型输出。
- 反向搜索:一项功能,可搜索使模型生成特定词语或短语所需的特定内部修改。
- MLX 优化:专为 Apple Silicon 优化,使用自定义内核实现高性能。
相关
- 项目
- Dispatch
- 项目
- 项目
- Dispatch