Qwen3.5-LiveTranslate-Flash 릴리스 노트

Qwen은 Qwen3.5-Omni 아키텍처를 기반으로 구축된 동시 통역 모델인 Qwen3.5-LiveTranslate-Flash를 발표했습니다. 이 모델은 오디오와 시각적 컨텍스트를 통합하여 실시간 다중모달 번역을 가능하게 하며, 교차 언어 음성 클로닝을 통해 번역 정확도와 화자 일관성을 향상시킵니다.

주요 기술 업그레이드

Qwen3.5-LiveTranslate-Flash는 이전 모델인 Qwen3-LiveTranslate에 비해 언어 지원 범위, 지연 시간, 용어 처리 측면에서 상당한 개선을 도입했습니다.

확장된 언어 지원

이 모델은 언어 능력을 크게 확장했습니다:

  • 입력 오디오 및 출력 텍스트: 18개에서 60개 언어로 증가했습니다.
  • 출력 오디오: 10개에서 29개 언어로 증가했습니다.

읽기 가능한 단위 기술을 통한 초저지연

동시 통역에서 지연을 최소화하기 위해 모델은 새로운 "Readable Unit" 실시간 번역 기법을 활용합니다. 이 전략은 의미 일관성과 가독성을 유지하면서 보다 적극적인 스트리밍 출력을 가능하게 합니다.

성능 벤치마크에 따르면 Qwen3.5-LiveTranslate-Flash는 이전 버전에 비해 첫 토큰 지연을 3.45초, 토큰당 지연을 1.88초 감소시켜 평균 음성-음성 토큰당 지연을 2.8초로 달성했습니다.

실시간 음성 클로닝

시스템은 단일 문장만으로 화자의 음성 특성을 복제할 수 있어, 번역된 음성이 다양한 언어에서도 원래 화자와 같은 목소리로 들리게 합니다. 이 기능은 사전 등록, 한 번 클론, 실시간의 세 가지 모드를 지원합니다.

동적 핫워드 강화

고유명사와 산업 특화 용어의 오번역을 줄이기 위해 모델은 내장된 핫워드 기능을 포함합니다. 사용자는 시나리오별로 이름, 장소, 브랜드명, 제품 모델 등을 실시간으로 동적으로 구성하고 업데이트할 수 있습니다.

모델 아키텍처

Qwen3.5-LiveTranslate는 Qwen3.5-Omni Thinker-Talker 아키텍처를 기반으로 합니다:

  • Thinker: 시각 및 오디오 입력을 교차 처리하여 텍스트 번역을 생성합니다.
  • Talker: 번역된 텍스트와 원본 오디오를 사용해 교차 언어 음성 클로닝을 통한 음성을 생성합니다.

실시간 통역을 위해 모델은 청크 단위 스트리밍 입력 메커니즘과 Readable Unit 태그를 사용하여 음성 합성의 세분성을 제어합니다.

다중모달 기능 및 사용 사례

Qwen3.5-LiveTranslate-Flash는 시각적 컨텍스트를 활용해 번역 모호성을 해소합니다. 화면 텍스트나 장면의 객체를 사용해 단어나 구문의 올바른 의미를 선택합니다.

주요 적용 시나리오는 다음과 같습니다:

  • 국제 회의: 실시간으로 코드 스위칭, 다양한 억양, 도메인 특화 용어를 처리합니다.
  • 여행: AI 안경과 통합하여 시각적 컨텍스트(예: 메뉴)와 음성 대화를 결합해 기기 내 번역을 제공합니다.
  • 라이브 스트리밍: 전자상거래 현지화를 위해 제품 사양 및 수치 데이터를 정확히 번역합니다.
  • 문학 번역: 삼국지연의와 같은 고전 중국어(文言文)와 같은 고어를 현대 영어로 번역합니다.

DashScope API를 통한 구현

모델은 WebSocket 연결(wss://dashscope.aliyuncs.com/api-ws/v1/realtime)을 사용한 DashScope API를 통해 접근할 수 있습니다. API는 다음을 지원합니다:

  • 모달리티: 텍스트와 오디오 모두 또는 텍스트 전용으로 출력 구성을 할 수 있습니다.
  • 입력: 시각적 컨텍스트를 위한 PCM 오디오 청크와 이미지 프레임.
  • 맞춤 설정: 특정 구문에 대한 정확도를 높이기 위해 핫워드를 등록하는 corpus 필드.

향후 개발 방향

Qwen은 다음에 집중하여 모델을 더욱 발전시킬 계획입니다:

  • 실시간 한계에 가까운 종단 간 지연 시간 추가 감소.
  • 저자원 언어 및 지역 방언에 대한 지원 확대.
  • 장문 대화에서 용어와 이름의 일관성 향상.
  • 주변 소리와 현장 분위기를 포함하도록 음성 클로닝 충실도 강화.
  • 제스처, 입 움직임, 표정을 위한 공동 다중모달 모델링 통합.

SUMMARY: Qwen3.5-LiveTranslate-Flash는 Qwen3.5-Omni를 기반으로 구축된 동시 통역 모델로, 초저지연 및 음성 클로닝을 통해 60개 언어에 대한 실시간 다중모달 번역을 제공합니다.

TITLE: Qwen3.5-LiveTranslate-Flash 릴리스 노트

Sources