Qwen2.5-VL 출시 노트
Qwen은 3B, 7B, 72B 크기로 제공되는 주력 비전-언어 모델인 Qwen2.5-VL을 출시했으며, 고급 시각 에이전트 기능, 장시간 비디오 이해, 구조화된 문서 파싱을 도입했습니다.
Qwen 글로벌-배치 로드 밸런스 MoE LLM 훈련
Qwen은 전체 글로벌 배치를 기준으로 균형을 계산함으로써 개별 마이크로 배치 대신 MoE 모델 성능을 향상시키고 전문가 특화를 가능하게 하는 글로벌-배치 로드 밸런스 손실을 도입합니다.
Qwen2.5-Math-PRM 및 ProcessBench 출시
Qwen은 수학 문제 해결에서 중간 추론 오류를 식별하도록 설계된 최첨단 프로세스 보상 모델인 Qwen2.5-Math-PRM-7B와 72B를 출시했으며, 새로운 단계 수준 평가 벤치마크인 ProcessBench도 함께 공개했습니다.
QVQ-72B-Preview 출시
Qwen은 Qwen2-VL-72B를 기반으로 한 오픈 웨이트 멀티모달 추론 모델인 QVQ-72B-Preview를 출시했으며, MMMU 벤치마크에서 70.3점을 달성했습니다.
QwQ-32B-Preview: 깊은 추론 기능 탐구
Qwen은 내부 사유 과정(chain-of-thought)을 통해 깊은 추론과 복잡한 문제 해결을 위한 모델인 QwQ-32B-Preview를 도입했습니다.
Qwen2.5-Turbo 1M 토큰 컨텍스트 길이 출시
Qwen은 Qwen2.5-Turbo를 출시했으며, 이는 모델의 컨텍스트 윈도우를 1백만 토큰으로 확장하면서 추론 속도를 크게 향상시키고 짧은 시퀀스 작업에서 경쟁력 있는 성능을 유지합니다.
Qwen2.5-Coder 시리즈 릴리스 노트
Qwen은 0.5B부터 32B까지 여섯 가지 모델 크기를 갖춘 Qwen2.5-Coder 시리즈를 출시했으며, 32B-Instruct 모델은 코딩 작업에서 GPT-4o와 comparable한 SOTA 오픈소스 성능을 달성했습니다.
Qwen2.5 릴리스 노트: 새로운 기반, 코더 및 수학 모델
Qwen은 일반 목적 LLM, 특화된 코더 및 수학 변형, 그리고 업데이트된 Qwen2-VL-72B를 포함한 포괄적인 오픈-웨이트 밀집 디코더 전용 모델 스위트인 Qwen2.5를 출시했습니다.
Qwen2.5 LLM 시리즈 출시
Qwen은 Qwen2.5 시리즈를 발표했습니다 – 0.5B에서 72B 파라미터까지의 오픈소스 디코더‑전용 LLM으로, Qwen2 대비 능력이 두 배가 되었으며 18조 토큰 규모의 데이터셋, 지식·코딩·수학·정렬에서 큰 향상, 그리고 128K 토큰 컨텍스트 윈도우를 추가했습니다.
Qwen2.5-Coder 릴리스 노트
Qwen은 5.5조 토큰으로 학습된 오픈소스 코딩 모델 시리즈인 Qwen2.5-Coder를 출시했으며, 코드 생성, 추론 및 수학 분야에서 더 큰 모델보다 뛰어난 성능을 보입니다.
Qwen2.5-Math 릴리즈 노트
Qwen은 Qwen2.5-Math를 출시했습니다. 이 시리즈는 양방향 추론과 도구 통합 추론(TIR)을 지원하는 오픈소스 수학 LLM으로, 복잡한 수학 벤치마크에서 선도적인 폐쇄형 모델들을 능가합니다.
Qwen2-VL 릴리스: 오픈소스 2B/7B 비전‑언어 모델 및 72B API와 최첨단 이미지, 비디오, 다국어 기능
Qwen은 Qwen2-VL을 출시했습니다. 이는 새로운 비전‑언어 모델 시리즈(2B, 7B 오픈소스, 72B API)로, 이미지, 문서, 다국어 및 장시간 비디오 이해에서 최첨단 성능을 달성하고 시각 에이전트 기능을 지원합니다.
Qwen2-Audio 릴리즈 노트
Qwen2-Audio는 8개 이상의 언어와 방언에 걸쳐 음성 채팅 및 오디오 분석이 가능한 오디오-언어 모델로, 여러 벤치마크에서 이전 최신 성능을 능가합니다.
Qwen2-Math 릴리즈 노트
Qwen은 Qwen2-Math라는 특화된 수학 LLM 시리즈(1.5B, 7B, 72B)를 출시했으며, 수학 벤치마크에서 GPT-4o를 포함한 여러 폐쇄형 모델보다 뛰어난 성능을 보입니다.
Qwen2 릴리즈 노트 / 새로운 소식
Qwen은 Qwen2를 발표했습니다. 0.5B에서 72B 파라미터까지 다섯 가지 오픈소스 모델 시리즈이며, 27개의 추가 언어에 대한 다국어 지원이 강화되고 컨텍스트 길이가 최대 128K 토큰까지 확장되었습니다.
Qwen-Agent: 8k에서 1M 컨텍스트로 LLM 일반화
Qwen은 8k 컨텍스트 모델이 1M 토큰을 처리할 수 있게 하는 에이전트 프레임워크를 개발했으며, 특정 벤치마크에서 RAG와 네이티브 장기 컨텍스트 모델을 모두 능가합니다.
Qwen-Max-0428 릴리스 노트
Qwen은 MT-Bench에서 Qwen1.5-110B-Chat을 능가하고 Chatbot Arena 리더보드 상위 10위에 오른 instruction-tuned 채팅 모델인 Qwen-Max-0428을 출시했습니다.
Qwen1.5-110B 릴리스 노트 / 새로운 내용
Qwen은 Qwen1.5 시리즈에서 처음으로 1000억 파라미터를 초과한 Qwen1.5-110B를 출시했으며, Llama-3-70B와 경쟁력 있는 성능을 제공하고 Qwen1.5-72B에 비해 크게 향상되었습니다.
CodeQwen1.5 릴리스 노트
Qwen은 개발자 생산성을 높이기 위해 92개의 프로그래밍 언어와 64K 토큰 컨텍스트 윈도우를 지원하는 오픈소스 코드 LLM인 CodeQwen1.5-7B를 출시했습니다.
Qwen1.5-32B 릴리스 노트 / 새로운 점
Qwen은 72B 버전에 비해 메모리와 추론 비용을 낮추면서 높은 성능을 균형 있게 제공하도록 설계된 Qwen1.5-32B 및 Qwen1.5-32B-Chat 모델을 출시했습니다.
Qwen1.5-MoE-A2.7B 릴리즈 노트
Qwen은 27억 개의 활성화된 파라미터만 사용하면서 7B 밀집 모델의 성능에 버금가는 Mixture-of-Experts 모델인 Qwen1.5-MoE-A2.7B를 소개합니다.
Qwen1.5 릴리즈 노트 / 새로운 소식
Qwen은 0.5B에서 110B 파라미터에 이르는 오픈소스 베이스 및 챗 모델 시리즈인 Qwen1.5를 출시했으며, 인간 정렬 개선, 다국어 기능, Hugging Face transformers와의 네이티브 통합을 특징으로 합니다.
Qwen-VL-Plus 및 Qwen-VL-Max 출시
Qwen은 멀티모달 작업에서 GPT-4V와 Gemini Ultra에 필적하고, 중국어 텍스트 이해에서는 이를 능가하는 대형 시각 언어 모델인 Qwen-VL-Plus와 Qwen-VL-Max를 출시했습니다.
Qwen 소개: 포괄적인 LLM 및 LMM 프레임워크
Qwen은 다국어 대형 언어 모델(LLM)과 대형 멀티모달 모델(LMM) 시리즈로 구성된 AGI를 향한 프로젝트이며, 1.8B에서 72B 파라미터에 이르는 오픈소스 버전을 포함합니다.
OFASys: 다중모달 멀티태스크 학습을 위한 프레임워크
Qwen은 사용자가 단일 라인 Instruction 인터페이스를 통해 복잡한 작업과 모달리티를 정의할 수 있게 함으로써 다중모달 멀티태스크 학습을 간소화하는 AI 프레임워크인 OFASys를 소개합니다.
Chinese CLIP: 중국어 대비 비전-언어 사전학습
Qwen은 문화적·언어적 한계를 극복하도록 설계된 비전-언어 모델인 Chinese CLIP을 출시했습니다. 이 모델은 교차 모달 검색 및 이미지 분류에서 영어 중심 CLIP 모델의 한계를 뛰어넘습니다.
OFA: 하나의 모델을 위한 구축을 향해
OFA는 지시 기반 멀티태스크 사전학습을 활용하여 모달리티 전반에 걸친 이해와 생성 작업을 하나의 프레임워크로 통합하는 통합 멀티모달 사전학습 모델이다.