Qwen3-Coder 릴리스 노트

Qwen은 에이전트 작업을 위해 설계된 고성능 코드 모델인 Qwen3-Coder를 발표했습니다. 대표 변형인 Qwen3-Coder-480B-A35B-Instruct는 480B 파라미터의 Mixture-of-Experts(MoE) 모델로, 35B 활성 파라미터를 가지고 있으며, 에이전트 코딩, 도구 사용 및 브라우저 사용 분야에서 오픈 모델 중 새로운 최첨단 결과를 달성했으며 Claude Sonnet 4와 비슷한 성능을 보입니다.

기술 아키텍처 및 사전 학습

Qwen3-Coder는 총 파라미터 수와 계산 효율성을 균형 있게 맞추기 위해 Mixture-of-Experts 아키텍처를 활용합니다. 사전 학습 과정은 세 가지 주요 스케일링 차원에 초점을 맞추었습니다:

  • Token Scaling: 모델은 7.5조 토큰을 사용해 학습되었으며, 코드 비율이 70%로 강력한 코딩 능력을 보장하면서 일반 지식이나 수학적 추론을 희생하지 않도록 했습니다.
  • Context Window Scaling: Qwen3-Coder는 기본적으로 256K 토큰 컨텍스트 윈도우를 지원하며, YaRN을 사용해 100만 토큰까지 확장할 수 있습니다. 이 용량은 저장소 규모 데이터와 Pull Request와 같은 동적 입력을 처리하도록 최적화되었습니다.
  • Synthetic Data Scaling: 팀은 Qwen2.5-Coder를 사용해 노이즈가 많은 학습 데이터를 정제하고 재작성하여 사전 학습 코퍼스의 전반적인 품질을 향상시켰습니다.

사후 학습 및 강화 학습

Qwen3-Coder의 능력은 실행과 장기 과제에 초점을 맞춘 두 가지 별도 강화 학습(RL) 전략에 의해 구동됩니다.

실행 기반 코드 RL

경쟁 프로그래밍에만 집중하는 대신, Qwen3-Coder는 실제 코딩 작업의 광범위한 집합에 대해 대규모 RL을 사용해 학습되었습니다. 다양한 코딩 작업에 대한 테스트 케이스를 자동으로 스케일링함으로써 모델은 코드 실행 성공률과 다른 작업에 대한 전반적인 성능을 향상시켰습니다.

장기 과제 에이전트 RL

복잡한 소프트웨어 엔지니어링 작업(예: SWE-Bench) 을 해결하기 위해 모델은 "Agent RL" 훈련을 받았습니다. 이 과정은 모델이 다중 턴 상호작용—계획, 도구 사용, 피드백 반영—을 수행하도록 장려하여 문제를 해결합니다. 이를 지원하기 위해 Qwen은 Alibaba Cloud에 20,000개의 독립 환경을 병렬로 실행할 수 있는 확장 가능한 인프라를 구축했습니다. 그 결과, Qwen3-Coder는 테스트 시 스케일링 없이도 SWE-Bench Verified에서 오픈소스 모델 중 최첨단 성능을 달성했습니다.

도구 및 통합

Qwen은 Qwen3-Coder를 개발 워크플로에 통합하는 여러 방법을 소개했습니다:

Qwen Code CLI

Qwen Code는 Gemini Code를 포크하여 연구 목적의 명령줄 인터페이스(CLI) 도구이며, Qwen3-Coder에 특화된 맞춤 프롬프트와 함수 호출 프로토콜을 적용했습니다.

타사 도구 지원

Qwen3-Coder는 여러 인기 개발자 도구와 호환됩니다:

  • Claude Code: 사용자는 프록시 API 또는 claude-code-routerclaude-code-config npm 패키지를 통해 Qwen3-Coder를 통합할 수 있습니다.
  • Cline: 모델은 Cline에서 "OpenAI Compatible" 제공자를 선택하고 Dashscope API 엔드포인트를 사용하여 설정할 수 있습니다.

API 접근 및 향후 방향

Qwen3-Coder는 Alibaba Cloud Model Studio API를 통해 제공됩니다. qwen3-coder-plus 모델 식별자는 OpenAI 호환 인터페이스를 통한 API 호출에 사용됩니다.

Qwen3-Coder의 향후 개발에는 배포 비용을 낮추기 위한 추가 모델 크기 출시와 점점 복잡해지는 소프트웨어 엔지니어링 작업을 처리하기 위한 코딩 에이전트의 자체 개선 기능 탐색이 포함됩니다.

Sources