Qwen-Scope 可解釋性工具包發布

Qwen 推出了 Qwen-Scope,一款旨在解碼 Qwen3 與 Qwen3.5 系列模型內部機制的可解釋性工具包。透過使用稀疏自編碼器(SAE),該工具包將密集的隱藏表示分解為稀疏、解耦且可解釋的特徵,使開發者能夠超越事後分析,主動優化模型效能。

Qwen-Scope 的技術實作

Qwen-Scope 在大型語言模型的隱藏層中插入稀疏自編碼器(SAE)以施加稀疏性約束。此過程將模型的密集內部計算轉換為人類可理解的概念與模式。

為確保訓練穩定且特徵覆蓋廣泛,Qwen 團隊從相應模型的預訓練資料中抽樣了 0.5 億個 token。該工具包包含 14 套 SAE,覆蓋 7 種不同的 LLM,包括來自 Qwen3 與 Qwen3.5 系列的密集與混合專家(MoE)架構。

支援的模型與 SAE 配置

名稱 骨幹類型 SAE 寬度 擴展因子 L0
SAE-Res-Qwen3-1.7B-Base-W32K-L0_50 Base 32K 16 50
SAE-Res-Qwen3-1.7B-Base-W32K-L0_100 Base 32K 16 100
SAE-Res-Qwen3-8B-Base-W64K-L0_50 Base 64K 16 50
SAE-Res-Qwen3-8B-Base-W64K-L0_100 Base 64K 16 100
SAE-Res-Qwen3.5-2B-Base-W32K-L0_50 Base 32K 16 50
SAE-Res-Qwen3.5-2B-Base-W32K-L0_100 Base 32K 16 100
SAE-Res-Qwen3.5-9B-Base-W64K-L0_50 Base 64K 16 50
SAE-Res-Qwen3.5-9B-Base-W64K-L0_100 Base 64K 16 100
SAE-Res-Qwen3.5-27B-W80K-L0_50 Instruct 80K 16 50
SAE-Res-Qwen3.5-27B-W80K-L0_100 Instruct 80K 16 100
SAE-Res-Qwen3-30B-A3B-Base-W32K-L0_50 Base 32K 16 50
SAE-Res-Qwen3-30B-A3B-Base-W128K-L0_100 Base 128K 64 100
SAE-Res-Qwen3.5-35B-A3B-Base-W32K-L0_50 Base 32K 16 50
SAE-Res-Qwen3.5-35B-A3B-Base-W128K-L0_100 Base 128K 64 100

核心應用與功能

Qwen-Scope 允許在推理、資料、訓練與評估四個主要面向上,針對模型行為進行精準控制與分析。

可控推理

透過操控特定特徵的激活,開發者可在推理結果上實現精準控制——例如修改語言、實體或風格——而無需明確的自然語言指令。

資料分類與合成

Qwen-Scope 透過分析模型表示,充當資料標記與分類工具。

  • 分類: 使用少量種子資料,工具包即可找出與樣本分類高度相關的特徵(例如辨識有害文字),無需額外訓練,降低對大型引導資料集的依賴。
  • 合成: 工具包會找出在現有資料中很少或從未被激活的特徵。透過針對這些未激活特徵方向性地合成補充樣本,Qwen 報告在覆蓋長尾能力方面,訓練資料效率提升約 15 倍。

目標微調與訓練

可解釋性特徵被用於在監督式微調(SFT)與強化學習(RL)期間指導訓練過程:

  • SFT: 透過定位與語碼切換等問題相關的異常激活模式(例如英文回覆中出現意外的中文詞彙),可設計特定的損失函數以減少此類不良回覆。
  • RL: 為了解決如無止盡重複生成等罕見問題,工具包可放大相應的異常激活特徵,提升在 RL 階段抽樣到此類情況的機率。

評估最佳化

Qwen-Scope 會分析測試集的特徵覆蓋情況,以找出冗餘與缺口。透過計算不同基準資料集的特徵激活模式,團隊發現部分常用資料集存在覆蓋重疊,使用者因此可選擇具更高覆蓋率且評估成本更低的測試樣本。

Sources