Qwen2.5-Omni 출시: 실시간 상호작용을 위한 엔드투엔드 멀티모달 모델

Qwen은 텍스트, 이미지, 오디오, 비디오 전반에 걸친 포괄적인 인식을 위해 설계된 플래그십 엔드투엔드 멀티모달 모델인 Qwen2.5-Omni를 출시했다고 발표했습니다. 이 모델은 텍스트 생성과 자연스러운 음성 합성 모두를 통해 실시간 스트리밍 응답을 가능하게 하여, 멀티모달 상호작용을 위한 응집력 있는 인터페이스를 제공합니다.

Thinker-Talker 아키텍처

Qwen2.5-Omni는 원활한 멀티모달 처리 및 생성을 달성하기 위해 새로운 "Thinker-Talker" 아키텍처를 활용합니다. 이 아키텍처는 모델의 기능적 역할을 두 가지 주요 구성 요소로 나눕니다:

  • Thinker: 중앙 처리 장치 역할을 하는 Thinker는 오디오 및 이미지 인코더에 의해 지원되는 Transformer decoder입니다. 텍스트, 오디오, 비디오 모달리티의 입력을 처리하여 고수준 표현과 텍스트를 생성합니다.
  • Talker: 출력 메커니즘 역할을 하는 Talker는 이중 트랙 자기회귀 Transformer Decoder입니다. Thinker로부터 고차원 표현과 텍스트를 스트리밍 방식으로 전달받아 이산적 음성 토큰을 유연하게 출력합니다.

Talker가 Thinker의 모든 과거 문맥 정보를 공유하기 때문에, 시스템은 단일 응집력 있는 모델로 작동하며 엔드투엔드 학습 및 추론을 가능하게 합니다.

Time-aligned Multimodal RoPE (TMRoPE)

비디오 입력의 타임스탬프를 오디오와 동기화하기 위해, Qwen2.5-Omni는 멀티모달 동기화를 위해 특별히 설계된 새로운 위치 임베딩인 TMRoPE (Time-aligned Multimodal RoPE)를 도입합니다.

기능 및 성능

Qwen2.5-Omni는 청크 단위 입력과 즉각적인 출력을 지원하여 실시간 음성 및 비디오 채팅을 위해 설계되었습니다. 이 모델은 여러 모달리티에 걸쳐 강력한 성능을 보여주며, 종종 유사한 크기의 단일 모달리티 모델과 경쟁할 수 있는 수준입니다.

멀티모달 통합

여러 모달리티의 통합이 필요한 작업에서, Qwen2.5-Omni는 OmniBench 벤치마크에서 최첨단 성능을 달성했습니다.

단일 모달리티 성능

이 모델은 여러 전문 분야에서 높은 숙련도를 보여줍니다:

  • Audio: 유사한 크기의 Qwen2-Audio 모델보다 오디오 기능에서 더 뛰어난 성능을 보이며, 음성 인식 (Common Voice), 번역 (CoVoST2), 및 오디오 이해 (MMAU)에서 강력한 결과를 보여줍니다.
  • Visual: 이미지 추론 (MMMU, MMStar) 및 비디오 이해 (MVBench)에서 Qwen2.5-VL-7B와 대등한 성능을 달성합니다.
  • Speech Generation: Seed-tts-eval 및 주관적 자연스러움 테스트를 통해 평가된 바와 같이, 음성 생성에서 우수한 견고성 및 자연스러움을 입증합니다.
  • Instruction Following: MMLU 및 GSM8K와 같은 벤치마크를 통해 입증된 바와 같이, 엔드투엔드 음성 지시 따르기 성능은 텍스트 입력을 사용할 때의 모델 효과성과 대등한 수준입니다.

향후 개발

Qwen은 Qwen2.5-Omni의 음성 명령 수행 능력을 더욱 강화하고 협업적인 오디오-비주얼 이해를 개선할 계획입니다. 또한 연구소는 추가적인 모달리티를를 통합하여 완전한 옴니 모델에 더 가까워지는 것을 목표로 합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch