Qwen3-Omni-Flash-2025-12-01 릴리스 노트
Qwen3-Omni-Flash-2025-12-01은 Qwen3-Omni 네이티브 멀티모달 대형 모델의 전면 업그레이드된 버전입니다. 텍스트, 이미지, 오디오, 비디오 입력을 원활하게 처리하고 실시간 스트리밍 응답을 통해 텍스트와 자연스러운 음성 출력을 동시에 생성합니다.
향상된 오디오-비주얼 상호작용 및 제어
Qwen3-Omni-Flash-2025-12-01은 다중 턴 오디오-비주얼 대화의 안정성과 일관성을 향상시켜 일상적인 대화 상황에서 자주 발생하는 "지능 저하" 문제를 해결합니다. 모델은 이제 오디오-비주얼 지시를 더 잘 이해하고 실행함으로써 보다 자연스러운 상호작용 경험을 제공합니다.
시스템 프롬프트 제어가 강화되어 모델 동작을 완전히 맞춤화할 수 있게 되었습니다. 사용자는 이제 애니메이션 스타일, 쿨함, 달콤함 등 퍼소나 스타일, 구어체 톤 선호도, 출력 길이 제한 등을 세밀하게 조정할 수 있습니다.
다국어 기능 및 음성 합성
모델은 이전 버전에서 발생했던 언어 추종 불안정을 해결하고 보다 신뢰할 수 있는 다국어 지원을 보장합니다. 지원 내용은 다음과 같습니다:
- 텍스트 기반 상호작용: 119개 언어
- 음성 인식: 19개 언어
- 음성 합성: 10개 언어
음성 합성이 업그레이드되어 로봇처럼 딱딱하거나 느린 전달을 없앴습니다. 운율에 대한 적응형 제어를 강화함으로써 모델은 텍스트 컨텍스트에 따라 억양, 멈춤, 말 속도를 지능적으로 조정하여 인간의 말처럼 자연스럽게 만듭니다.
성능 벤치마크
Qwen3-Omni-Flash-2025-12-01은 모든 모달리티에서 Qwen3-Omni-Flash 대비 상당한 향상을 보여줍니다:
텍스트 이해 및 생성
- 논리 추론: ZebraLogic에서 +5.6
- 코드 생성: LiveCodeBench-v6에서 +9.3, MultiPL-E에서 +2.7
- 작성 품질: WritingBench에서 +2.2
음성 이해 및 합성
- 음성 이해: VoiceBench에서 (+3.2) 향상 및 Fleurs-zh에서 단어 오류율 크게 감소.
- 음성 합성: 특히 중국어 및 다국어 환경에서 향상된 페이싱과 운율을 갖춘 고품질 인간 같은 음성 생성.
시각 및 비디오 이해
- 이미지 이해: 시각 추론 작업에서 MMMU에서 +4.7, MMMU-Pro에서 +4.8, MathVision_full에서 +2.2 향상.
- 비디오 이해: MLVU에서 +1.6 향상된 비디오 의미 이해 및 실시간 대화를 위한 더 긴밀한 오디오-비주얼 동기화.
향후 개발 로드맵
Qwen 팀은 다음과 같은 여러 방향으로 모델을 발전시킬 계획입니다:
- 다중 화자 ASR (자동 음성 인식)
- 비디오 OCR
- 오디오-비주얼 사전 학습
- 에이전트 기반 워크플로와 함수 호출에 대한 강화된 지원