Qwen-Scope 可解釋性工具包發布
Qwen 推出了 Qwen-Scope,一款旨在解碼 Qwen3 與 Qwen3.5 系列模型內部機制的可解釋性工具包。透過使用稀疏自編碼器(SAE),該工具包將密集的隱藏表示分解為稀疏、解耦且可解釋的特徵,使開發者能夠超越事後分析,主動優化模型效能。
Qwen-Scope 的技術實作
Qwen-Scope 在大型語言模型的隱藏層中插入稀疏自編碼器(SAE)以施加稀疏性約束。此過程將模型的密集內部計算轉換為人類可理解的概念與模式。
為確保訓練穩定且特徵覆蓋廣泛,Qwen 團隊從相應模型的預訓練資料中抽樣了 0.5 億個 token。該工具包包含 14 套 SAE,覆蓋 7 種不同的 LLM,包括來自 Qwen3 與 Qwen3.5 系列的密集與混合專家(MoE)架構。
支援的模型與 SAE 配置
| 名稱 | 骨幹類型 | SAE 寬度 | 擴展因子 | L0 |
|---|---|---|---|---|
| SAE-Res-Qwen3-1.7B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3-1.7B-Base-W32K-L0_100 | Base | 32K | 16 | 100 |
| SAE-Res-Qwen3-8B-Base-W64K-L0_50 | Base | 64K | 16 | 50 |
| SAE-Res-Qwen3-8B-Base-W64K-L0_100 | Base | 64K | 16 | 100 |
| SAE-Res-Qwen3.5-2B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3.5-2B-Base-W32K-L0_100 | Base | 32K | 16 | 100 |
| SAE-Res-Qwen3.5-9B-Base-W64K-L0_50 | Base | 64K | 16 | 50 |
| SAE-Res-Qwen3.5-9B-Base-W64K-L0_100 | Base | 64K | 16 | 100 |
| SAE-Res-Qwen3.5-27B-W80K-L0_50 | Instruct | 80K | 16 | 50 |
| SAE-Res-Qwen3.5-27B-W80K-L0_100 | Instruct | 80K | 16 | 100 |
| SAE-Res-Qwen3-30B-A3B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3-30B-A3B-Base-W128K-L0_100 | Base | 128K | 64 | 100 |
| SAE-Res-Qwen3.5-35B-A3B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3.5-35B-A3B-Base-W128K-L0_100 | Base | 128K | 64 | 100 |
核心應用與功能
Qwen-Scope 允許在推理、資料、訓練與評估四個主要面向上,針對模型行為進行精準控制與分析。
可控推理
透過操控特定特徵的激活,開發者可在推理結果上實現精準控制——例如修改語言、實體或風格——而無需明確的自然語言指令。
資料分類與合成
Qwen-Scope 透過分析模型表示,充當資料標記與分類工具。
- 分類: 使用少量種子資料,工具包即可找出與樣本分類高度相關的特徵(例如辨識有害文字),無需額外訓練,降低對大型引導資料集的依賴。
- 合成: 工具包會找出在現有資料中很少或從未被激活的特徵。透過針對這些未激活特徵方向性地合成補充樣本,Qwen 報告在覆蓋長尾能力方面,訓練資料效率提升約 15 倍。
目標微調與訓練
可解釋性特徵被用於在監督式微調(SFT)與強化學習(RL)期間指導訓練過程:
- SFT: 透過定位與語碼切換等問題相關的異常激活模式(例如英文回覆中出現意外的中文詞彙),可設計特定的損失函數以減少此類不良回覆。
- RL: 為了解決如無止盡重複生成等罕見問題,工具包可放大相應的異常激活特徵,提升在 RL 階段抽樣到此類情況的機率。
評估最佳化
Qwen-Scope 會分析測試集的特徵覆蓋情況,以找出冗餘與缺口。透過計算不同基準資料集的特徵激活模式,團隊發現部分常用資料集存在覆蓋重疊,使用者因此可選擇具更高覆蓋率且評估成本更低的測試樣本。