QwenLM/Qwen3.8
Qwen3.8 is the large language model series developed by Qwen team, Alibaba Group.
해결하는 문제
Qwen3.8은 복잡하고 다단계 작업을 더 높은 신뢰성으로 처리할 수 있도록 설계된 오픈웨이트 대규모 언어 모델 시리즈입니다. 특히 코딩, 전문 연구, 장기적 에이전트 작업에서의 개선에 초점을 맞추며 오픈소스 커뮤니티에 "Max-클래스" 성능을 제공합니다.
작동 방식
Qwen3.5의 아키텍처 기반으로 여러 단계를 거쳐 진화합니다:
- Qwen3.8: 자율적 계획과 환경 피드백을 개선하여 엔드투엔드 작업 완료를 향상시킵니다.
reasoning_effort를 도입해 추론 깊이를 조절 가능하게 하고,preserve_thinking을 통해 메시지 간 추론 컨텍스트를 유지할 수 있도록 합니다. - Qwen3.6: 안정성과 실제 활용성을 우선시하며, 프론트엔드 워크플로우용 에이전트 코딩과 리포지토리 수준의 추론을 특별히 강화합니다.
- Qwen3.5: 조기 융합 학습을 통한 통합된 시각-언어 기반, 하이브리드 아키텍처(게이트형 델타 네트워크 및 희소 Mixture-of-Experts), 그리고 백만 에이전트 환경에서 확장된 강화학습을 사용합니다.
대상 사용자
소프트웨어 개발, 자율 에이전트, 다중 모달 애플리케이션에 고성능 오픈 모델을 필요로 하는 개발자 및 기업. 201개의 언어 및 방언을 지원합니다.
주요 특징
- 에이전트 기능: 더 강력한 자율적 계획 능력과 환경 피드백 처리 능력으로 신뢰성 있는 작업 완료를 가능하게 합니다.
- 통합된 멀티모달 기반: 트리리온 토큰 이상의 데이터로 조기 융합 학습을 수행하여 추론, 코딩, 시각 이해 능력의 균형을 맞춥니다.
- 유연한 사고 제어: 추론 깊이를 조절하고 대화 중 추론 컨텍스트를 유지할 수 있습니다.
- 광범위한 호환성: vLLM, SGLang, TokenSpeed와 같은 주요 추론 엔진과 Unsloth, Llama-Factory와 같은 훈련 프레임워크에서 지원됩니다.
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch