Qwen-Scope 해석 가능성 툴킷 출시
Qwen은 Qwen3 및 Qwen3.5 시리즈 모델의 내부 메커니즘을 해독하도록 설계된 해석 가능성 툴킷인 Qwen-Scope를 소개했습니다. Sparse Autoencoders(SAE)를 활용하여 이 툴킷은 조밀한 은닉 표현을 희소하고, 분리된, 해석 가능한 특징으로 분해함으로써 개발자들이 사후 분석을 넘어 모델 성능을 적극적으로 최적화할 수 있게 합니다.
Qwen-Scope의 기술 구현
Qwen-Scope는 LLM의 은닉 층에 Sparse Autoencoders(SAE)를 삽입하여 희소성 제약을 부여합니다. 이 과정은 모델의 조밀한 내부 연산을 인간이 이해할 수 있는 개념과 패턴으로 변환합니다.
안정적인 학습과 폭넓은 특징 커버리지를 보장하기 위해 Qwen 팀은 해당 모델들의 사전 학습 데이터에서 0.5B 토큰을 샘플링했습니다. 이 툴킷은 Qwen3 및 Qwen3.5 시리즈의 조밀형과 Mixture-of-Experts(MoE) 아키텍처를 포함한 7개의 서로 다른 LLM을 아우르는 14개의 SAE 세트를 포함합니다.
지원되는 모델 및 SAE 구성
| 이름 | 백본 유형 | SAE 폭 | 확장 계수 | L0 |
|---|---|---|---|---|
| SAE-Res-Qwen3-1.7B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3-1.7B-Base-W32K-L0_100 | Base | 32K | 16 | 100 |
| SAE-Res-Qwen3-8B-Base-W64K-L0_50 | Base | 64K | 16 | 50 |
| SAE-Res-Qwen3-8B-Base-W64K-L0_100 | Base | 64K | 16 | 100 |
| SAE-Res-Qwen3.5-2B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3.5-2B-Base-W32K-L0_100 | Base | 32K | 16 | 100 |
| SAE-Res-Qwen3.5-9B-Base-W64K-L0_50 | Base | 64K | 16 | 50 |
| SAE-Res-Qwen3.5-9B-Base-W64K-L0_100 | Base | 64K | 16 | 100 |
| SAE-Res-Qwen3.5-27B-W80K-L0_50 | Instruct | 80K | 16 | 50 |
| SAE-Res-Qwen3.5-27B-W80K-L0_100 | Instruct | 80K | 16 | 100 |
| SAE-Res-Qwen3-30B-A3B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3-30B-A3B-Base-W128K-L0_100 | Base | 128K | 64 | 100 |
| SAE-Res-Qwen3.5-35B-A3B-Base-W32K-L0_50 | Base | 32K | 16 | 50 |
| SAE-Res-Qwen3.5-35B-A3B-Base-W128K-L0_100 | Base | 128K | 64 | 100 |
핵심 적용 분야 및 기능
Qwen-Scope는 추론, 데이터, 학습, 평가 네 가지 주요 차원에서 모델 행동을 목표 지향적으로 제어하고 분석할 수 있게 합니다.
제어 가능한 추론
특정 특징의 활성화를 조작함으로써 개발자는 명시적인 자연어 지시 없이도 언어, 엔터티, 스타일 등을 변경하는 등 추론 결과를 목표 지향적으로 제어할 수 있습니다.
데이터 분류 및 합성
Qwen-Scope는 모델 표현을 분석하여 데이터 라벨링 및 분류 도구로 작동합니다.
- 분류: 소량의 시드 데이터를 사용하여 툴킷은 추가 학습 없이 샘플 분류에 매우 관련성 높은 특징을 식별할 수 있습니다(예: 유해 텍스트 식별). 이를 통해 대규모 부트스트랩 데이터셋에 대한 의존도를 감소시킵니다.
- 합성: 툴킷은 기존 데이터에서 거의 혹은 전혀 활성화되지 않은 특징을 식별합니다. 이러한 비활성 특징을 기반으로 보조 샘플을 방향성 있게 합성함으로써 Qwen은 장기 꼬리 능력을 커버하기 위한 학습 데이터 효율 비율이 약 15배 향상되었다고 보고합니다.
목표 기반 파인튜닝 및 학습
해석 가능성 특징은 감독 파인튜닝(SFT) 및 강화 학습(RL) 과정에서 학습을 안내하는 데 사용됩니다:
- SFT: 코드 스위칭과 같은 문제(예: 영어 응답에 예상치 못한 중국어 단어)와 연관된 이상 활성화 패턴을 정확히 찾아내어, 이러한 바람직하지 않은 응답을 감소시키는 특정 손실 함수를 설계할 수 있습니다.
- RL: 무한 반복 생성과 같은 드물게 발생하는 문제를 해결하기 위해, 툴킷은 해당 이상 활성화 특징을 증폭시켜 RL 단계에서 이러한 사례가 샘플링될 가능성을 높일 수 있습니다.
평가 최적화
Qwen-Scope는 테스트 세트 전반에 걸친 특징 커버리지를 분석하여 중복 및 빈틈을 식별합니다. 다양한 벤치마크 데이터셋에 대한 특징 활성화 패턴을 계산함으로써, 팀은 일부 흔히 사용되는 데이터셋이 중복된 커버리지를 가지고 있음을 발견했으며, 이를 통해 사용자는 더 높은 커버리지와 낮은 평가 비용을 가진 테스트 샘플을 선택할 수 있습니다.
SUMMARY: Qwen은 Sparse Autoencoders(SAE)를 사용하여 Qwen3 및 Qwen3.5 모델의 은닉 표현을 해석 가능한 특징으로 분해하고 모델 최적화를 위한 해석 가능성 툴킷인 Qwen-Scope를 출시했습니다.
TITLE: Qwen-Scope 해석 가능성 툴킷 출시