Qwen3.8-Omni-Flash 릴리스 노트

Qwen3.8-Omni-Flash는 AI 에이전트가 단순한 콘텐츠 이해를 넘어 자율적인 작업 계획 및 실행으로 전환할 수 있도록 설계된 차세대 네이티브 옴니모달 모델입니다. 1M 토큰 컨텍스트 윈도우를 통해 텍스트, 이미지, 오디오 및 비디오 입력을 지원하며, Gemini 3.8 Flash와 대등한 시청각 성능과 이를 능가하는 전반적인 오디오 성능을 제공합니다.

에이전트 기반 시청각 이해

Qwen3.8-Omni-Flash는 장문 콘텐츠에 에이전트 워크플로우를 적용하여 정적인 처리를 넘어섭니다. 모델은 전체 비디오를 선형적으로 처리하는 대신, 어떤 부분을 시청하거나 청취할지 독립적으로 결정하며, 여러 차례의 거친 단계에서 세밀한 단계로 이어지는 증거 수집 과정을 통해 핵심 정보를 찾아냅니다.

OmniVideoBench 벤치마크에서 이러한 에이전트 방식은 정확도를 63.4에서 67.8로 향상시키는 동시에 토큰 소비량을 약 45.7%(쿼리당 145,736에서 79,117 토큰으로) 절감했습니다.

주요 장문 처리 기능

  • 제어 가능한 캡셔닝: 사용자가 비디오 설명의 주제, 시간 범위, 세부 수준을 지정할 수 있어 카메라 샷, 조명, 사운드에 대한 구조화된 분석이 가능합니다.
  • 회의 인텔리전스: 모델은 최대 1시간 분량의 시청각 입력을 기본적으로 지원하며, 화자 분할, 신원 식별, 콘텐츠 전사를 엔드투엔드로 수행하여 회의록과 실행 항목을 생성합니다.
  • 심층 연구: 모델은 비디오 콘텐츠와 웹 기반 멀티모달 검색을 결합하여 시각 자료가 포함된 연구 보고서를 작성할 수 있습니다.

시청각 제작 및 편집

이 모델은 도구를 계획하고 호출하여 완성된 미디어 자산을 제공함으로써 엔드투엔드 전문 워크플로우를 가능하게 합니다:

  • Music2MV: 노래의 리듬, 분위기, 보컬을 분석하여 캐릭터와 장면을 설계하고, 시각적 정렬을 위한 타임스탬프가 포함된 라인 단위 가사를 출력합니다.
  • 단편 드라마 번역: 국제 현지화를 위해 화자 인식, 음성 복제, 더빙, 오디오 리믹싱을 자동화합니다.
  • 영화 해설: 장편 영화에서 핵심 줄거리를 추출하여 해설 비디오를 기획 및 제작하며, 원본 대사와 내레이션을 교차 편집하기 위해 말하기 속도와 볼륨을 자동으로 조정합니다.

Qwen3.8-Omni-Flash-Realtime

저지연 상호작용을 위해 Qwen3.8-Omni-Flash-Realtime 변형 모델은 WebSocket 및 WebRTC를 통해 실시간 시청각 스트림을 인식하고 응답합니다.

실시간 혁신

  • 공간 오디오 인식: 모델은 공간 음향과 시각 정보를 결합하여 음원의 방향과 거리를 결정함으로써 오디오 신호(예: "이쪽으로 와")에 기반한 로봇 내비게이션을 가능하게 합니다.
  • 말하기 연습: 발음과 의미론을 공동 모델링하여 자연스러운 감정을 유지하면서 실시간으로 억양과 음조 편차를 교정합니다.
  • 동적 지식 주입: "Skills"를 통해 신원 설정 및 비즈니스 규칙 주입을 지원하여 고객 서비스와 같은 특정 애플리케이션에 맞게 모델의 역할을 조정할 수 있습니다.

모델 최적화 및 정보 압축

Qwen3.8-Omni-Flash는 더 작은 모델을 최적화하는 데 사용할 수 있습니다. 한 실험에서 이 모델은 Qwen2.5-Omni-3B의 사천 방언 음성 인식을 개선하는 임무를 맡았습니다. 문제를 독립적으로 진단하고 타겟팅된 학습 데이터를 구성함으로써 12시간 이내에 문자 오류율을 25.79%에서 15.30%로(상대적 감소율 40.7%) 줄였습니다.

또한, 이 모델은 비디오 튜토리얼을 핵심 스크린샷과 단계별 지침이 포함된 구조화된 PDF 노트로 변환하는 Video2Note와 같은 도구와, 시연 비디오에서 표준 운영 절차(SOP)를 추출하여 재사용 가능한 Skill.md 파일로 만드는 Omni Skill Creator를 구동합니다.

벤치마크 및 성능

옴니모달 지능

Qwen3.8-Omni-Flash는 강력한 도구 사용 능력을 보여주며, WildClawBench-MM에서 71.0점, UniClawBench에서 69.6점을 기록하여 특정 지표에서 Qwen3.5-Omni-Plus 및 Gemini 3.8 Flash를 능가했습니다.

텍스트 및 비전

  • 코딩: SWE-bench Pro에서 63.3점을 기록하여 Claude-Opus-4.6 (Max)의 53.4점을 앞섰습니다.
  • 비전: 모바일 사용을 위한 AndroidWorld에서 87.1점을 기록하여 Claude-Opus-4.6 (Max)의 62.0점보다 상당히 높은 점수를 받았습니다.

처리량 및 지연 시간

실시간 API 성능은 입력 지속 시간과 양식에 따라 첫 토큰 생성 시간(TTFT)이 591ms에서 981ms 사이, 첫 오디오 패킷 생성 시간이 978ms에서 1350ms 사이로 나타납니다.

커뮤니티 인사이트 및 비용 분석

기술 사용자들 사이의 논의에서는 Qwen3.8-Omni-Flash가 경쟁사 대비 상당한 비용 우위를 점하고 있다는 점이 강조되었습니다. 한 사용자는 다음과 같이 언급했습니다:

"성능이 비슷하다면... 입/출력 ($) Gemini : 1.5 / 9.0 | Qwen 3.8: 0.15 / 0.47 이것은 엄청난 비용 절감입니다." — @handle

다른 사용자들은 Qwen-Live Harness 저장소의 가용성에 대해 우려를 표하며, 출시 직후 404 오류가 발생했다는 보고와 함께 Omni 모델이 오픈 웨이트로 공개될지 여부에 대해 질문했습니다.

기술 구현

API 구성

이 모델은 분석의 깊이와 비용 및 속도 간의 균형을 맞추기 위해 reasoning_effort 설정(xhigh, medium, low)을 지원합니다. OpenAI Chat Completions 및 Responses API와 호환됩니다.

플러그인 생태계

Qwen-MM-Plugins는 이미지 읽기, OCR, 화자 분할, 비디오에서 MV 또는 PDF 노트 생성 등을 처리하기 위해 에이전트 하네스(Claude Code 및 OpenClaw 포함)를 위한 도구 모음을 제공합니다.

Sources

관련