Qwen3.5-Omni 릴리스 노트
TL;DR
Qwen은 Qwen3.5‑Omni를 출시했습니다. 이는 텍스트, 이미지, 오디오, 비디오를 기본적으로 처리하고 256k 토큰 컨텍스트를 지원하며, 다국어 음성 인식(113개 언어) 및 합성(36개 언어)을 추가하고 의미 있는 턴테이킹, 웹 검색, 함수 호출, 음성 제어, 음성 클로닝과 같은 실시간 상호작용 기능을 제공하는 새로운 세대의 완전 옴니모달 대형 언어 모델입니다.
개요
Qwen3.5‑Omni는 Qwen의 옴니모달 제품군의 최신 버전입니다. 이전 Qwen3‑Omni의 모달리티 범위를 대규모 텍스트, 시각 데이터 및 1억 시간 이상의 오디오‑비주얼 데이터에 대한 사전 학습을 통해 확장했습니다. 모델 제품군은 Plus, Flash, Light라는 세 가지 instruction‑tuned 크기로 구성되며, 모두 256 k 토큰까지의 컨텍스트를 허용합니다. Qwen3.5‑Omni는 10시간 이상의 원시 오디오 또는 1 fps의 720p 비디오 400초를 단일 요청으로 처리할 수 있습니다.
아키텍처
The Thinker‑Talker design from Qwen3‑Omni is retained and refined:
- Thinker는 Vision Encoder를 통해 시각 프레임을, AuT 모듈을 통해 오디오를 받습니다. 오디오‑비주얼 스트림은 TMRoPE를 사용한 위치 인코딩으로 교차 배치됩니다. Thinker는 융합된 옴니모달 표현을 처리하고 텍스트 출력을 생성합니다.
- Talker는 Thinker의 텍스트와 멀티모달 신호를 사용해 음성을 생성합니다. 음성 토큰은 무거운 DiT 블록 대신 RVQ(Residual Vector Quantization)로 인코딩되어 효율적인 스트리밍을 가능하게 합니다.
- Thinker와 Talker 모두 Hybrid‑Attention Mixture‑of‑Experts (MoE) 레이어를 사용하여 용량을 확장하면서 추론 비용을 관리 가능한 수준으로 유지합니다.
- 실시간 상호작용은 Thinker에 대한 청크 단위 스트리밍 입력과 텍스트와 음성 토큰을 **ARIA (Adaptive Rate Interleave Alignment)**를 사용해 교차 배치하는 스트리밍 Talker를 통해 구현됩니다. ARIA는 토큰 속도를 동적으로 정렬하여 누락, 오독, 숫자 발음 불안정성을 제거합니다.
멀티모달 기능
| 기능 | 세부 정보 |
|---|---|
| Modalities | 텍스트, 이미지, 원시 오디오, 그리고 오디오‑비주얼 스트림(비디오 + 오디오). |
| Context Length | 최대 256 k 토큰(≈ 400 k 문자). |
| Audio Processing | 10시간 이상의 연속 오디오를 처리하며, 113개 언어/방언에 대한 음성‑텍스트 변환을 지원합니다. |
| Audio‑Visual Processing | 1 fps의 720p 비디오를 최대 400초까지 수용하며, 구조화된 타임스탬프 캡션 및 시나리오 수준 설명을 생성할 수 있습니다. |
| Speech Generation | 36개 언어/방언으로 음성을 합성하고, 음성 클로닝 및 볼륨, 속도, 감정에 대한 세밀한 제어를 지원합니다. |
| Long‑Form Reasoning | 256 k 컨텍스트를 통해 문서 수준 분석, 다중 턴 대화, 복잡한 도구 사용을 잘라내지 않고 수행할 수 있습니다. |
성능 하이라이트
Qwen3.5‑Omni‑Plus(가장 큰 instruction‑tuned 변형)는 215개의 오디오 및 오디오‑비주얼 벤치마크에서 최첨단 결과를 달성합니다. 선택된 수치(높을수록 좋음, 별도 언급 없을 경우):
- Audio‑Visual Understanding – 일반 오디오 이해, 추론, 인식, 번역 및 대화에서 Gemini‑3.1 Pro를 능가하고, 전체 오디오‑비주얼 점수에서는 Gemini‑3.1 Pro와 일치합니다.
- Audio‑Visual Captioning – 자동 세분화, 타임스탬프 및 캐릭터 관계 설명이 포함된 제어 가능한 상세 캡션을 생성합니다.
- Speech Synthesis Stability – 단어 오류율(Word Error Rate, WER) 기준으로, Qwen3.5‑Omni‑Plus는 공개된 20언어 다국어 TTS 세트에서 12.62 % WER를 기록했으며, ElevenLabs(13.08 %)와 Gemini‑2.5 Pro(다른 지표에서 2.72 %)보다 우수합니다.
- Multilingual Speech Recognition – 8개의 ASR 벤치마크와 156개의 언어별 음성‑텍스트 작업에서 최고 순위 점수를 달성했습니다.
- Vision & Text – 시각 벤치마크(예: VQA, OCR, 공간 추론)에서 모델은 동일 크기의 Qwen3.5 텍스트 전용 모델과 동등한 성능을 보입니다.
새로운 인터랙티브 기능 (실시간 API)
Qwen3.5‑Omni는 실시간 어시스턴트와 대화형 에이전트에 적합한 여러 기능을 추가했습니다:
- Semantic Interruption – 기본 턴테이킹 의도 감지를 통해 실수로 발생하는 백채널링을 방지하고 배경 소음을 필터링합니다.
- WebSearch & Function Calling – 모델은 대화 중에 웹 검색을 수행하거나 외부 함수를 호출할지 자동으로 결정할 수 있습니다.
- End‑to‑End Voice Control – 사용자는 음성 명령으로 말하기 볼륨, 속도, 감정 톤을 실시간으로 조정할 수 있습니다.
- Voice Cloning – 짧은 음성 샘플을 업로드하면 모델이 이후 응답에 해당 음성을 사용합니다.
- System Prompt Customisation – 개발자는 시스템 프롬프트를 수정해 대화 스타일이나 페르소나를 재학습 없이 변경할 수 있습니다.
- ARIA Alignment – 텍스트와 음성 토큰 속도가 달라도 스트리밍 음성이 일관성을 유지하도록 보장하여 자연스러움을 크게 향상시킵니다.
새로운 기능: Audio‑Visual Vibe Coding
스케일링 실험 중 Qwen3.5‑Omni는 오디오‑비주얼 지시로부터 직접 코드를 작성하는 능력을 보여주었습니다. 모델은 비디오 시연(예: UI 상호작용)을 해석해 해당 소스 코드를 생성할 수 있으며, 저자들은 이를 Audio‑Visual Vibe Coding이라고 명명했습니다. 이 기능은 Offline API를 통해 제공됩니다.
데모 하이라이트
- Audio‑Visual Captioning – 모델은 3분 길이의 야생동물 다큐멘터리에 대해 시나리오 스타일의 타임스탬프 캡션을 생성하며, 등장인물 이름, 효과음 주석, 장면 전환 등을 포함합니다.
- Multilingual Speech Interaction – 사용자가 중국어를 말하면 모델이 클론된 중국어 음성으로 응답하고, 이어서 다른 클론된 음성으로 영어로 전환하는 등 동일 세션 내에서 다언어 상호작용을 수행합니다.
- Tool Use – 실시간 채팅에서 모델이 현재 날짜를 웹 검색하고 결과를 가져와 명시적인 프롬프트 없이 답변에 포함합니다.
이용 가능성
Qwen3.5‑Omni는 두 가지 엔드포인트를 통해 접근할 수 있습니다:
- Offline API – 배치 처리, 대규모 오디오‑비주얼 분석 및 Audio‑Visual Vibe Coding 사용 사례에 적합합니다.
- Realtime API – 저지연 음성 어시스턴트를 위해 최적화되었으며, 위에 나열된 인터랙티브 기능을 지원합니다.
개발자는 Qwen Chat 인터페이스, Hugging Face, 또는 ModelScope를 통해 모델을 얻을 수 있으며(오프라인 및 실시간 데모 모두 제공), 블로그 게시물에는 오프라인 및 실시간 호출을 위한 예제 코드가 포함되어 있습니다.
시사점
Qwen3.5‑Omni는 네이티브 옴니모달 AGI를 향한 구체적인 단계로, 인식(시각, 오디오, 비디오)과 생성(텍스트, 음성, 코드)을 단일 아키텍처에 통합합니다. 큰 컨텍스트 윈도우와 다국어 음성 기능은 다국어 미디어 분석 및 캡션부터 복잡한 오디오‑비주얼 신호를 이해하고 응답할 수 있는 실시간 가상 어시스턴트에 이르기까지 적용 범위를 확대합니다. Audio‑Visual Vibe Coding의 등장으로 향후 모델은 시연과 구현 사이의 격차를 메우며, 많은 분야에서 수동 프로그래밍 필요성을 줄일 수 있음을 시사합니다.
인용
If you reference Qwen3.5‑Omni, please cite:
@misc{qwen35omniblog,
title = {Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI},
url = {https://qwen.ai/blog?id=qwen3.5-omni},
author = {Qwen Team},
month = {March},
year = {2026}
}