Qwen-Scope 可解释性工具包发布
Qwen 已推出 Qwen-Scope,这是一款旨在解码 Qwen3 与 Qwen3.5 系列模型内部机制的可解释性工具包。通过使用稀疏自编码器(SAE),该工具包将密集的隐藏表征分解为稀疏、解耦且可解释的特征,使开发者能够超越事后分析,主动优化模型性能。
Qwen-Scope 的技术实现
Qwen-Scope 在大语言模型的隐藏层中插入稀疏自编码器(SAE),以施加稀疏约束。此过程将模型的密集内部计算转化为人类可理解的概念和模式。
为确保训练稳定且特征覆盖广泛,Qwen 团队从相应模型的预训练数据中抽样了 0.5B(5 亿)标记。该工具包包含 14 组 SAE,覆盖 7 种不同的大语言模型,包括 Qwen3 与 Qwen3.5 系列中的密集和混合专家(MoE)架构。
支持的模型与 SAE 配置
| 名称 | 骨干类型 | SAE 宽度 | 扩展因子 | L0 |
|---|---|---|---|---|
| SAE-Res-Qwen3-1.7B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3-1.7B-Base-W32K-L0_100 | Base | 32K | 16 | 100 |
| SAE-Res-Qwen3-8B-Base-W64K-L0_50 | Base | 64K | 16 | 50 |
| SAE-Res-Qwen3-8B-Base-W64K-L0_100 | Base | 64K | 16 | 100 |
| SAE-Res-Qwen3.5-2B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3.5-2B-Base-W32K-L0_100 | Base | 32K | 16 | 100 |
| SAE-Res-Qwen3.5-9B-Base-W64K-L0_50 | Base | 64K | 16 | 50 |
| SAE-Res-Qwen3.5-9B-Base-W64K-L0_100 | Base | 64K | 16 | 100 |
| SAE-Res-Qwen3.5-27B-W80K-L0_50 | Instruct | 80K | 16 | 50 |
| SAE-Res-Qwen3.5-27B-W80K-L0_100 | Instruct | 80K | 16 | 100 |
| SAE-Res-Qwen3-30B-A3B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3-30B-A3B-Base-W128K-L0_100 | Base | 128K | 64 | 100 |
| SAE-Res-Qwen3.5-35B-A3B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3.5-35B-A3B-Base-W128K-L0_100 | Base | 128K | 64 | 100 |
核心应用与能力
Qwen-Scope 可在推理、数据、训练和评估四个主要维度上实现对模型行为的针对性控制与分析。
可控推理
通过操控特定特征的激活,开发者能够对推理结果进行有针对性的控制——例如修改语言、实体或风格——而无需显式的自然语言指令。
数据分类与合成
Qwen-Scope 通过分析模型表征,充当数据标注与分类工具。
- 分类: 使用少量种子数据,工具包即可识别与样本分类高度相关的特征(例如识别有害文本),无需额外训练,从而降低对大规模引导数据集的依赖。
- 合成: 工具包识别出在现有数据中很少或从未激活的特征。基于这些未激活特征有方向地合成补充样本,Qwen 报告在覆盖长尾能力方面,训练数据效率提升约 15 倍。
针对性微调与训练
可解释性特征用于在监督微调(SFT)和强化学习(RL)阶段指导训练过程:
- SFT: 通过定位与代码切换等问题相关的异常激活模式(例如英文回复中出现意外的中文词汇),可以设计特定的损失函数以降低这些不良响应。
- RL: 为解决诸如无限重复生成等罕见问题,工具包可以放大相应的异常激活特征,以提升在 RL 阶段抽样到这些情况的概率。
评估优化
Qwen-Scope 对测试集的特征覆盖进行分析,以识别冗余与缺口。通过计算不同基准数据集的特征激活模式,团队发现部分常用数据集存在覆盖重叠,从而使用户能够选择覆盖更高且评估成本更低的测试样本。