QwQ-32B 릴리스 노트 / 새로운 기능

Qwen은 QwQ-32B를 소개했습니다. 이는 스케일된 강화 학습(RL)을 활용하여 6710억 파라미터 DeepSeek-R1과 비교 가능한 추론 능력을 갖춘 320억 파라미터 모델입니다. 이 릴리스는 방대한 세계 지식을 갖춘 견고한 기초 모델에 RL을 적용하면 지능과 추론 효율성을 크게 향상시킬 수 있음을 보여줍니다.

추론을 위한 강화 학습 스케일링

QwQ-32B는 전통적인 사전 학습 및 사후 학습 방법을 넘어 추론 능력을 확장하기 위해 다단계 강화 학습 접근 방식을 사용합니다.

1단계: 도메인별 RL

초기 단계에서 RL은 수학 및 코딩 작업에 특화되어 스케일링됩니다. 전통적인 보상 모델에 의존하지 않고 정확성을 보장하기 위해 Qwen은 다음과 같이 결과 기반 보상을 구현했습니다:

  • 정확성 검증기: 수학 문제의 최종 솔루션 정확성을 검증하는 데 사용됩니다.
  • 코드 실행 서버: 생성된 코드가 사전 정의된 테스트 케이스를 성공적으로 통과하는지 평가하는 데 사용됩니다.

2단계: 일반 능력 RL

도메인별 단계 이후, 두 번째 단계의 RL은 일반 능력에 초점을 맞춥니다. 이 단계는 일반 보상 모델과 규칙 기반 검증기에서의 보상을 활용합니다. 이 짧은 훈련 단계는 수학 또는 코딩 숙련도에 큰 저하 없이 지시 사항 따르기, 인간 선호도 일치, 그리고 에이전트 성능을 향상시킵니다.

모델 기능 및 성능

QwQ-32B는 복잡한 문제 해결, 수학적 추론, 그리고 코딩을 위해 설계되었습니다. 에이전트 관련 기능을 통합하여 모델이 도구를 사용하면서 비판적으로 생각하고, 환경으로부터의 피드백에 따라 추론을 조정할 수 있도록 합니다.

성능 평가는 QwQ-32B가 다음과 같은 선도적인 모델과 경쟁력을 갖춘 것을 보여줍니다:

  • DeepSeek-R1
  • o1-mini
  • DeepSeek-R1-Distilled-Llama-70B
  • DeepSeek-R1-Distilled-Qwen-32B

배포 및 접근성

QwQ-32B는 Apache 2.0 라이선스 하에 출시된 오픈 웨이트 모델입니다. 다음과 같은 채널을 통해 이용할 수 있습니다:

  • Hugging Face와 ModelScope: Transformers를 통한 로컬 배포를 위한 오픈 웨이트 액세스.
  • Qwen Chat: 웹 인터페이스를 통해 접근 가능.
  • Alibaba Cloud DashScope API: 프로그래밍 방식 통합을 위해 이용 가능.

미래 연구 방향

Qwen은 인공 일반 지능(AGI)으로 나아가기 위해 기초 모델과 스케일된 강화 학습의 교차점을 더 탐구할 계획입니다. 미래 연구의 주요 초점 영역은 다음과 같습니다:

  • 추론 시간 스케일링: 추론 과정에서 계산을 스케일링하여 더 높은 지능을 잠금 해제.
  • 장기 범위 추론: 에이전트와 RL을 통합하여 모델이 더 긴 기간 동안 복잡하고 다단계 추론 작업을 처리할 수 있도록 합니다.

Sources