Qwen-Scope 可解释性工具包发布

Qwen 已推出 Qwen-Scope,这是一款旨在解码 Qwen3 与 Qwen3.5 系列模型内部机制的可解释性工具包。通过使用稀疏自编码器(SAE),该工具包将密集的隐藏表征分解为稀疏、解耦且可解释的特征,使开发者能够超越事后分析,主动优化模型性能。

Qwen-Scope 的技术实现

Qwen-Scope 在大语言模型的隐藏层中插入稀疏自编码器(SAE),以施加稀疏约束。此过程将模型的密集内部计算转化为人类可理解的概念和模式。

为确保训练稳定且特征覆盖广泛,Qwen 团队从相应模型的预训练数据中抽样了 0.5B(5 亿)标记。该工具包包含 14 组 SAE,覆盖 7 种不同的大语言模型,包括 Qwen3 与 Qwen3.5 系列中的密集和混合专家(MoE)架构。

支持的模型与 SAE 配置

名称 骨干类型 SAE 宽度 扩展因子 L0
SAE-Res-Qwen3-1.7B-Base-W32K-L0_50 Base 32K 16 50
SAE-Res-Qwen3-1.7B-Base-W32K-L0_100 Base 32K 16 100
SAE-Res-Qwen3-8B-Base-W64K-L0_50 Base 64K 16 50
SAE-Res-Qwen3-8B-Base-W64K-L0_100 Base 64K 16 100
SAE-Res-Qwen3.5-2B-Base-W32K-L0_50 Base 32K 16 50
SAE-Res-Qwen3.5-2B-Base-W32K-L0_100 Base 32K 16 100
SAE-Res-Qwen3.5-9B-Base-W64K-L0_50 Base 64K 16 50
SAE-Res-Qwen3.5-9B-Base-W64K-L0_100 Base 64K 16 100
SAE-Res-Qwen3.5-27B-W80K-L0_50 Instruct 80K 16 50
SAE-Res-Qwen3.5-27B-W80K-L0_100 Instruct 80K 16 100
SAE-Res-Qwen3-30B-A3B-Base-W32K-L0_50 Base 32K 16 50
SAE-Res-Qwen3-30B-A3B-Base-W128K-L0_100 Base 128K 64 100
SAE-Res-Qwen3.5-35B-A3B-Base-W32K-L0_50 Base 32K 16 50
SAE-Res-Qwen3.5-35B-A3B-Base-W128K-L0_100 Base 128K 64 100

核心应用与能力

Qwen-Scope 可在推理、数据、训练和评估四个主要维度上实现对模型行为的针对性控制与分析。

可控推理

通过操控特定特征的激活,开发者能够对推理结果进行有针对性的控制——例如修改语言、实体或风格——而无需显式的自然语言指令。

数据分类与合成

Qwen-Scope 通过分析模型表征,充当数据标注与分类工具。

  • 分类: 使用少量种子数据,工具包即可识别与样本分类高度相关的特征(例如识别有害文本),无需额外训练,从而降低对大规模引导数据集的依赖。
  • 合成: 工具包识别出在现有数据中很少或从未激活的特征。基于这些未激活特征有方向地合成补充样本,Qwen 报告在覆盖长尾能力方面,训练数据效率提升约 15 倍。

针对性微调与训练

可解释性特征用于在监督微调(SFT)和强化学习(RL)阶段指导训练过程:

  • SFT: 通过定位与代码切换等问题相关的异常激活模式(例如英文回复中出现意外的中文词汇),可以设计特定的损失函数以降低这些不良响应。
  • RL: 为解决诸如无限重复生成等罕见问题,工具包可以放大相应的异常激活特征,以提升在 RL 阶段抽样到这些情况的概率。

评估优化

Qwen-Scope 对测试集的特征覆盖进行分析,以识别冗余与缺口。通过计算不同基准数据集的特征激活模式,团队发现部分常用数据集存在覆盖重叠,从而使用户能够选择覆盖更高且评估成本更低的测试样本。

Sources