Qwen3.8-Omni-Flash 릴리스: 100만 토큰 컨텍스트를 갖춘 다모달 에이전트 모델

TL;DR

Qwen3.8-Omni-Flash는 텍스트, 이미지, 오디오, 비디오 입력을 지원하며 100만 토큰의 컨텍스트 창을 갖춘 새로운 다모달 언어 모델로, 실제 업무 워크플로우를 위한 에이전트 기반 계획 및 도구 사용 기능을 제공하며, 이전 모델 대비 오디오-시각 API 가격을 90% 이상 절감합니다.


핵심 기술적 진보

1. 100만 토큰 컨텍스트 창 – 모델은 다모달 데이터 최대 100만 토큰을 처리하면서 텍스트 전용 모델과 동일한 크기의 모델 수준의 텍스트 성능을 유지합니다.

2. 에이전트 기반 다모달 추론 – Qwen3.8-Omni-Flash는 사용자 질문에서 시작해 인지 및 도구 사용 단계의 계획을 세우고, 장시간 오디오-시각 스트림에서 반복적으로 증거를 수집할 수 있습니다. 이 에이전트 모드는 OmniVideoBench에서 정확도를 63.4%에서 67.8%로 향상시키며, 토큰 소비량은 약 45.7% 감소시킵니다.

3. 비용 절감 – 표준 720p @ 1fps 가격 정책 기준으로 Qwen3.5-Omni-Plus 대비 오디오 입력의 시간당 가격은 >98% 감소하고, 오디오-시각 입력은 >93% 감소합니다.

4. 확장성 향상 – 29개 벤치마크 평가에서 모델의 평균 점수는 Qwen3.5-Omni-Plus 대비 >25% 향상되었으며, 특히 WildClawBench-MM (+36.5점) 및 AgenticVBench (+22.3점)에서 큰 성과를 보였습니다. 오디오-시각 성능은 Gemini 3.8 Flash와 비슷하거나 이를 초과합니다.


벤치마크 주요 성과

벤치마크 Qwen3.8‑Omni‑Flash Qwen3.5‑Omni‑Plus Gemini 3.8 Flash
WildClawBench‑MM (다모달 도구 사용) 71.0 34.5 58.9
UniClawBench (다모달 도구 사용) 69.6 67.1 69.0
AgenticVBench (다모달 도구 사용) 36.8 14.5 45.0
OmniVideoBench (오디오-시각 추론) – 정적 63.4 53.8 65.2
OmniVideoBench – 에이전트 기반 67.8 53.8 65.2
OmniCap‑IF CSR 80.6 (↑8.5) 72.1 81.9
OmniCap‑IF ISR 28.2 (↑14.1) 14.1 28.3
AliMeeting DER / cpWER **3.4 17.2** (88.1 89.6에서 감소)

볼드체로 표시된 점수는 비교 대상 시스템 중 최고입니다. Qwen3.5‑Omni‑Plus 대비 향상된 점수는 괄호 안에 표시됩니다.


새로운 에이전트 기능

조절 가능한 오디오-시각 캡션 생성

사용자가 지정한 주제, 시간 범위, 세부 수준, 출력 형식에 맞춰 비디오 캡션을 생성할 수 있습니다. 이 기능은 고수준 개요부터 조명, 카메라 앵글, 사운드 디자인에 이르기까지 세밀한 분석까지 다양한 활용 사례를 가능하게 합니다.

장시간 오디오-시각 이해

다시간 녹화된 자료에 대해 에이전트는 전체 스트림을 처리하지 않습니다. 대신 거시적에서 미시적까지의 증거 수집을 수행하여 질문에 답하는 세그먼트에 컴퓨팅 자원을 집중시킵니다. 토큰 사용량은 거의 절반으로 줄어들고 정확도는 향상됩니다.

회의 지능

Qwen3.8-Omni-Flash는 오디오와 비디오를 종합적으로 분석하여 발화자 구분, 내용 번역, 정체성 일치를 수행하고, 회의록, 행동 항목, 리스크 분석을 생성할 수 있습니다. 통합 도구 호출을 통해 회의 결과에 따라 후속 이메일 발송, 작업 생성, 심지어 코드 작성까지 수행할 수 있습니다.

연구 지원 비디오 탐색

사용자가 비디오를 넘어서는 질문을 할 경우, 모델은 보완되는 다모달 자료(이미지, 문서, 다른 비디오)를 검색하고 풍부한 시각 자료를 포함한 연구 보고서를 생성할 수 있습니다. 예를 들어, Photoshop 블렌드 모드의 세부 사항을 설명하는 데 활용할 수 있습니다.

엔드투엔드 오디오-시각 제작

모델은 음악 비디오 제작, 단편 드라마 로컬라이제이션, 장시간 영화 리뷰 등 완전한 제작 파이프라인을 지원합니다. 사용자는 단일 고수준 지시만 제공하면 에이전트가 계획을 세우고 창의적 도구를 호출하여 완성된 비디오를 제공합니다.


생태계 확장

Qwen‑MM‑Plugins – 장시간 오디오-시각 콘텐츠를 위한 인식, 도구 사용, 워크플로우 실행 기능을 추가하는 플러그인 세트입니다. 포함된 플러그인:

  • omni-chatcut: 음악 비디오 생성용
  • omni-video2note: 튜토리얼을 PDF 노트로 변환용
  • omni-skill-creator: 시연에서 재사용 가능한 SOP 추출용
  • omni-memory: 세션 간 지속적인 오디오-시각 기억 구축용

Qwen‑Live Harness – 오픈소스 런타임으로, 실시간 API (qwen3.8-omni-flash-realtime)를 에이전트 프레임워크와 연결하여 지속적인 오디오-시각 스트림, 메모리 관리, 능동적인 작업 위임을 처리합니다.


실시간 상호작용 (Qwen3.8‑Omni‑Flash‑Realtime)

실시간 변형은 실시간 오디오-시각 스트림을 초당 약 85토큰 속도로 처리하며, 텍스트 및 오디오 모두에서 첫 토큰 지연이 1초 미만입니다. 지원 기능:

  • 발음 연습 – 비표준 발음 스타일을 표준 발음으로 정렬하면서 리듬과 감정을 유지합니다.
  • 공간 오디오 인식 – 시각적 맥락을 활용해 3차원 공간에서 소리의 원천을 위치 파악할 수 있어, "여기로 와"와 같은 명령어를 지원합니다.
  • 동적 지식 주입 – 기술이 브랜드 언어, 비즈니스 규칙, 도메인 지식을 실시간으로 로드할 수 있어, 단일 모델이 다양한 역할을 수행할 수 있습니다.

API 사용 사례

  • OpenAI 호환 채팅 완성 지원.
  • reasoning_effort 매개변수 (xhigh, medium, low)로 깊이 대 비용 조절 가능.
  • preserve_thinking은 기본적으로 활성화되어 투명한 사고 과정 출력을 보장합니다.
  • 예제 파이썬 스크립트는 이미지 + 오디오 + 텍스트의 혼합 모달 입력과 스트리밍 응답을 보여줍니다.

AI 기반 생산성에 대한 함의

Qwen3.8-Omni-Flash는 다모달 모델을 수동적 인식에서 자율적인 작업 실행으로 전환합니다. 장시간 오디오-시각 추론, 에이전트 기반 계획, 저비용 API를 통합함으로써 새로운 유형의 애플리케이션을 가능하게 합니다:

  • 완전 자동화된 비디오 편집 및 로컬라이제이션 파이프라인.
  • 결정을 요약하는 것뿐만 아니라 실행하는 실시간 회의 보조 도구.
  • 단일 프롬프트로 수시간에 걸친 멀티미디어 콘텐츠를 질의하고 간결하고 실행 가능한 출력을 받는 지식 종사자.
  • 대규모 모델이 반복적으로 소규모 전문 모델을 개선하는 모델 기반 R&D 루프로, 사천 방언 음성 인식에서 40%의 상대적 CER 감소를 통해 이를 입증했습니다.

시작하기

  1. Qianwen AI 플랫폼에서 API 키를 획득합니다.
  2. 모델 이름 qwen3.8-omni-flash (실시간 스트림은 qwen3.8-omni-flash-realtime)를 사용해 OpenAI 호환 엔드포인트를 사용합니다.
  3. 제공된 설치 스크립트를 통해 Qwen-MM-Plugins 세트를 설치하여 인식 및 도구 사용 기능을 활성화합니다.
  4. 실시간 애플리케이션의 경우 websocket-client, pyaudio, opencv-python을 설치하고 샘플 WebSocket 클라이언트 코드를 따릅니다.

인용

@misc{qwen38omniflash,
  title = {Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.},
  url = {https://qwen.ai/blog?id=qwen3.8-omni-flash},
  author = {{Qwen Team}},
  month = {September},
  year = {2026}
}

Sources