Lucid:通过雅可比透镜可视化 LLM 内部表征
Lucid 是由 Earthpilot Laboratory 开发的基于网页的工具,使用户能够在语言模型处理提示时实时观察其内部概念表征。通过使用雅可比透镜,Lucid 揭示模型在不同层上持有的概念,在生成最终输出之前,让用户看到哪些概念被激活,哪些被抑制。
可视化 LLM 的“全局工作空间”
Lucid 将模型的内部状态视为输入与答案之间的空间。它聚焦于“J-space”,这是 Anthropic 用来描述模型能够报告、重定向和推理的特权内部表征集合的术语。这类似于认知科学中的全局工作空间理论,其中一组信息被提供给意识访问。
该工具允许用户输入提示,并监控哪些概念在特定层次进入该工作空间。此可视化使得能够识别模型正在考虑但最终决定不在最终回复中包含的概念。
技术实现:雅可比透镜 vs. Logit 透镜
Lucid 通过在单次前向传播期间读取模型的内部表征来工作。该透镜对每个模型只需拟合一次,工具支持包括 Qwen(0.5B 到 3B)和 Pythia(1.4B)在内的小型开源模型。
用户之间的技术讨论突出了雅可比透镜与 Logit 透镜的区别:
- Logit 透镜: 假设残差流在各层保持相同的基底,实际上将内部状态直接投射到最终词表。
- 雅可比透镜: 校正从初始层到最终层的基底变化。这在残差流在模型中移动时改变其表征基底的某些架构上更为有效。
用户体验与可访问性
Lucid 被设计为一个开放的“阅读室”,无需账户或安装。主要特性包括:
- 概念追踪: 用户可以查看每层和每个位置的顶级概念,并对固定的 token 进行排名追踪。
- 可共享会话: 每个会话都可以导出为可共享的切片页面。
- 交互式探索: 该工具提供一个指南(“Docent”)帮助用户理解术语以及如何阅读该工具。
Earthpilot Laboratory 的相关研究
除了 Lucid,Earthpilot Laboratory 还开发了 Personality Bench,这是一款将前沿模型通过人格测试以分析其行为特征的工具(可在 persona.earthpilot.ai 获取)。
“我喜欢对答案前思考阶段的关注。这感觉比仅仅使用通用系统提示来引导输出更实用得多。”
这种观点反映了向可解释性工具的转变,这类工具针对内部处理阶段,而不仅仅是提示工程中常见的输出引导。
Sources
相关
- 项目
- 项目
- Dispatch
- Dispatch
- Dispatch