Qwen3.5-Omni 릴리스 노트

TL;DR

Qwen은 Qwen3.5‑Omni를 출시했습니다. 이는 텍스트, 이미지, 오디오, 비디오를 기본적으로 처리하고 256k 토큰 컨텍스트를 지원하며, 다국어 음성 인식(113개 언어) 및 합성(36개 언어)을 추가하고 의미 있는 턴테이킹, 웹 검색, 함수 호출, 음성 제어, 음성 클로닝과 같은 실시간 상호작용 기능을 제공하는 새로운 세대의 완전 옴니모달 대형 언어 모델입니다.


개요

Qwen3.5‑Omni는 Qwen의 옴니모달 제품군의 최신 버전입니다. 이전 Qwen3‑Omni의 모달리티 범위를 대규모 텍스트, 시각 데이터 및 1억 시간 이상의 오디오‑비주얼 데이터에 대한 사전 학습을 통해 확장했습니다. 모델 제품군은 Plus, Flash, Light라는 세 가지 instruction‑tuned 크기로 구성되며, 모두 256 k 토큰까지의 컨텍스트를 허용합니다. Qwen3.5‑Omni는 10시간 이상의 원시 오디오 또는 1 fps의 720p 비디오 400초를 단일 요청으로 처리할 수 있습니다.

아키텍처

The Thinker‑Talker design from Qwen3‑Omni is retained and refined:

  • Thinker는 Vision Encoder를 통해 시각 프레임을, AuT 모듈을 통해 오디오를 받습니다. 오디오‑비주얼 스트림은 TMRoPE를 사용한 위치 인코딩으로 교차 배치됩니다. Thinker는 융합된 옴니모달 표현을 처리하고 텍스트 출력을 생성합니다.
  • Talker는 Thinker의 텍스트와 멀티모달 신호를 사용해 음성을 생성합니다. 음성 토큰은 무거운 DiT 블록 대신 RVQ(Residual Vector Quantization)로 인코딩되어 효율적인 스트리밍을 가능하게 합니다.
  • Thinker와 Talker 모두 Hybrid‑Attention Mixture‑of‑Experts (MoE) 레이어를 사용하여 용량을 확장하면서 추론 비용을 관리 가능한 수준으로 유지합니다.
  • 실시간 상호작용은 Thinker에 대한 청크 단위 스트리밍 입력과 텍스트와 음성 토큰을 **ARIA (Adaptive Rate Interleave Alignment)**를 사용해 교차 배치하는 스트리밍 Talker를 통해 구현됩니다. ARIA는 토큰 속도를 동적으로 정렬하여 누락, 오독, 숫자 발음 불안정성을 제거합니다.

멀티모달 기능

기능 세부 정보
Modalities 텍스트, 이미지, 원시 오디오, 그리고 오디오‑비주얼 스트림(비디오 + 오디오).
Context Length 최대 256 k 토큰(≈ 400 k 문자).
Audio Processing 10시간 이상의 연속 오디오를 처리하며, 113개 언어/방언에 대한 음성‑텍스트 변환을 지원합니다.
Audio‑Visual Processing 1 fps의 720p 비디오를 최대 400초까지 수용하며, 구조화된 타임스탬프 캡션 및 시나리오 수준 설명을 생성할 수 있습니다.
Speech Generation 36개 언어/방언으로 음성을 합성하고, 음성 클로닝 및 볼륨, 속도, 감정에 대한 세밀한 제어를 지원합니다.
Long‑Form Reasoning 256 k 컨텍스트를 통해 문서 수준 분석, 다중 턴 대화, 복잡한 도구 사용을 잘라내지 않고 수행할 수 있습니다.

성능 하이라이트

Qwen3.5‑Omni‑Plus(가장 큰 instruction‑tuned 변형)는 215개의 오디오 및 오디오‑비주얼 벤치마크에서 최첨단 결과를 달성합니다. 선택된 수치(높을수록 좋음, 별도 언급 없을 경우):

  • Audio‑Visual Understanding – 일반 오디오 이해, 추론, 인식, 번역 및 대화에서 Gemini‑3.1 Pro를 능가하고, 전체 오디오‑비주얼 점수에서는 Gemini‑3.1 Pro와 일치합니다.
  • Audio‑Visual Captioning – 자동 세분화, 타임스탬프 및 캐릭터 관계 설명이 포함된 제어 가능한 상세 캡션을 생성합니다.
  • Speech Synthesis Stability – 단어 오류율(Word Error Rate, WER) 기준으로, Qwen3.5‑Omni‑Plus는 공개된 20언어 다국어 TTS 세트에서 12.62 % WER를 기록했으며, ElevenLabs(13.08 %)와 Gemini‑2.5 Pro(다른 지표에서 2.72 %)보다 우수합니다.
  • Multilingual Speech Recognition – 8개의 ASR 벤치마크와 156개의 언어별 음성‑텍스트 작업에서 최고 순위 점수를 달성했습니다.
  • Vision & Text – 시각 벤치마크(예: VQA, OCR, 공간 추론)에서 모델은 동일 크기의 Qwen3.5 텍스트 전용 모델과 동등한 성능을 보입니다.

새로운 인터랙티브 기능 (실시간 API)

Qwen3.5‑Omni는 실시간 어시스턴트와 대화형 에이전트에 적합한 여러 기능을 추가했습니다:

  1. Semantic Interruption – 기본 턴테이킹 의도 감지를 통해 실수로 발생하는 백채널링을 방지하고 배경 소음을 필터링합니다.
  2. WebSearch & Function Calling – 모델은 대화 중에 웹 검색을 수행하거나 외부 함수를 호출할지 자동으로 결정할 수 있습니다.
  3. End‑to‑End Voice Control – 사용자는 음성 명령으로 말하기 볼륨, 속도, 감정 톤을 실시간으로 조정할 수 있습니다.
  4. Voice Cloning – 짧은 음성 샘플을 업로드하면 모델이 이후 응답에 해당 음성을 사용합니다.
  5. System Prompt Customisation – 개발자는 시스템 프롬프트를 수정해 대화 스타일이나 페르소나를 재학습 없이 변경할 수 있습니다.
  6. ARIA Alignment – 텍스트와 음성 토큰 속도가 달라도 스트리밍 음성이 일관성을 유지하도록 보장하여 자연스러움을 크게 향상시킵니다.

새로운 기능: Audio‑Visual Vibe Coding

스케일링 실험 중 Qwen3.5‑Omni는 오디오‑비주얼 지시로부터 직접 코드를 작성하는 능력을 보여주었습니다. 모델은 비디오 시연(예: UI 상호작용)을 해석해 해당 소스 코드를 생성할 수 있으며, 저자들은 이를 Audio‑Visual Vibe Coding이라고 명명했습니다. 이 기능은 Offline API를 통해 제공됩니다.

데모 하이라이트

  • Audio‑Visual Captioning – 모델은 3분 길이의 야생동물 다큐멘터리에 대해 시나리오 스타일의 타임스탬프 캡션을 생성하며, 등장인물 이름, 효과음 주석, 장면 전환 등을 포함합니다.
  • Multilingual Speech Interaction – 사용자가 중국어를 말하면 모델이 클론된 중국어 음성으로 응답하고, 이어서 다른 클론된 음성으로 영어로 전환하는 등 동일 세션 내에서 다언어 상호작용을 수행합니다.
  • Tool Use – 실시간 채팅에서 모델이 현재 날짜를 웹 검색하고 결과를 가져와 명시적인 프롬프트 없이 답변에 포함합니다.

이용 가능성

Qwen3.5‑Omni는 두 가지 엔드포인트를 통해 접근할 수 있습니다:

  • Offline API – 배치 처리, 대규모 오디오‑비주얼 분석 및 Audio‑Visual Vibe Coding 사용 사례에 적합합니다.
  • Realtime API – 저지연 음성 어시스턴트를 위해 최적화되었으며, 위에 나열된 인터랙티브 기능을 지원합니다.

개발자는 Qwen Chat 인터페이스, Hugging Face, 또는 ModelScope를 통해 모델을 얻을 수 있으며(오프라인 및 실시간 데모 모두 제공), 블로그 게시물에는 오프라인 및 실시간 호출을 위한 예제 코드가 포함되어 있습니다.

시사점

Qwen3.5‑Omni는 네이티브 옴니모달 AGI를 향한 구체적인 단계로, 인식(시각, 오디오, 비디오)과 생성(텍스트, 음성, 코드)을 단일 아키텍처에 통합합니다. 큰 컨텍스트 윈도우와 다국어 음성 기능은 다국어 미디어 분석 및 캡션부터 복잡한 오디오‑비주얼 신호를 이해하고 응답할 수 있는 실시간 가상 어시스턴트에 이르기까지 적용 범위를 확대합니다. Audio‑Visual Vibe Coding의 등장으로 향후 모델은 시연과 구현 사이의 격차를 메우며, 많은 분야에서 수동 프로그래밍 필요성을 줄일 수 있음을 시사합니다.

인용

If you reference Qwen3.5‑Omni, please cite:

@misc{qwen35omniblog,
  title = {Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI},
  url = {https://qwen.ai/blog?id=qwen3.5-omni},
  author = {Qwen Team},
  month = {March},
  year = {2026}
}

Sources