Qwen3.8-LiveTranslate 모델 출시
TL;DR
Qwen은 Qwen3.8‑LiveTranslate를 출시했으며, 이는 평균 지연 시간(LAAL)을 2.8초에서 2.3초로 줄이고, 실시간 화자 분리 및 음성 클로닝, 동기화된 이중 언어 화면 표시, 60개 언어에 대한 장문맥 의미 해석 기능을 도입한 동시 통역 시스템입니다.
주요 기술적 진보
인터리브 아키텍처가 품질과 지연 시간을 개선합니다
"음성과 텍스트가 서로 뒤섞여 있으며, 품질은 높고 지연 시간은 낮습니다. 이번 세대는 동시 통역을 단일 음성-텍스트 인터리브 스트림으로 재정의합니다. 이미 들은 음성과 이미 생성된 번역은 캐시하여 재사용할 수 있습니다." 인터리브 스트림은 모델이 들어오는 음성과 생성된 번역을 인과적 시퀀스로 처리할 수 있게 하여, 이전에 처리된 세그먼트를 재사용하고 평균 지연 시간(LAAL)을 2.8초에서 2.3초로 감소시킵니다.
실시간 화자 분리 및 음성 클로닝
"여러 사람이 차례로 말할 때, 모델은 각 화자의 구분과 그들이 말한 내용을 구분하며, 번역된 음성에서 각 화자의 음색을 더 정확하고 안정적으로 유지하는 데 도움을 줍니다." 각 번역 문장과 함께 화자 ID가 출력되며, Talker 모듈은 원본 화자의 음색을 반영하는 음성을 합성합니다.
동기화된 원문 및 번역 출력
"통역 중 이중 언어 정렬은 즉각적인 이해와 원문 확인을 지원하며, 자막 표시, 콘텐츠 정리 및 검색과 같은 후속 기능의 기반을 마련합니다." 서비스는 원문 텍스트와 번역을 하나의 응답으로 반환하여 양면 이중 언어 화면을 가능하게 합니다.
장문맥 의미 해석
"이전 텍스트와 역사적 맥락을 활용함으로써, 복잡한 상황에서 고유명사, 참조어 등의 모호성을 완화하고 표현의 일관성을 유지합니다." Thinker 모듈은 이전 대화를 인과적 시퀀스에 포함시켜 이름, 용어, 대명사 처리를 개선합니다.
모델 아키텍처
- 하이브리드-믹스처-오브-익스퍼트(MoE) Thinker–Talker 설계
- Thinker: 비디오, 음성, 원문 텍스트, 시각 프레임을 입력받아 하나의 인과적 시퀀스로 정렬합니다.
- Talker: 번역 텍스트와 원문 음성을 입력받아 원본 화자의 음색을 유지하는 음성을 합성합니다.
- 엔드투엔드 스트리밍 파이프라인: 음성 → 인터리브 표현 → 번역 → 음성 합성.
성능 평가
다중 화자 장음성 벤치마크(Omnilingua‑MSpeaker)
- 14개 언어 방향에 대해 다중 화자, 장시간 음성 데이터를 포함합니다.
- Qwen3.8‑LiveTranslate는 주요 실시간 통역 시스템보다 번역 충실도, 유창성, 간결성, 화자 분리 오류율(DER) 에서 우수합니다.
다국어 실시간 통역(FLEURS 음성 테스트 세트)
- 70개 언어 방향에서 평가되었습니다.
- 이전 Qwen 세대 및 경쟁 시스템보다 번역 품질, 평균 지연 시간, 음성 인식 정확도, 음성 합성 품질에서 선도적입니다.
원문에서는 구체적인 수치 점수가 공개되지 않았으며, 상대적 우수성에 한정된 주장입니다.
지원 언어
| 입력 음성 및 출력 텍스트 (60개) | 출력 음성 (29개) |
|---|---|
| 아프리카어, 아랍어, 아스투리아어, 아제르바이잔어, 벨라루스어, 벤골어, 보스니아어, 불가리아어, 광둥어, 카탈로니아어, 세부아노어, 중국어, 크로아티아어, 체코어, 덴마크어, 네덜란드어, 영어, 에스토니아어, 필리핀어, 핀란드어, 프랑스어, 갈리시아어, 구자라트어, 독일어, 그리스어, 히브리어, 힌디어, 헝가리어, 아이슬란드어, 인도네시아어, 이탈리아어, 일본어, 자와어, 칸나다어, 카자흐어, 한국어, 키르기스어, 라트비아어, 마케도니아어, 말레이어, 말라얄람어, 마라티어, 노르웨이어, 페르시아어, 폴란드어, 포르투갈어, 펀자브어, 루마니아어, 러시아어, 슬로바키아어, 슬로베니아어, 스페인어, 스와힐리어, 스웨덴어, 타지크어, 태국어, 터키어, 우크라이나어, 우르두어, 베트남어 | 중국어, 영어, 독일어, 이탈리아어, 포르투갈어, 스페인어, 일본어, 한국어, 프랑스어, 러시아어, 태국어, 인도네시아어, 아랍어, 베트남어, 터키어, 핀란드어, 폴란드어, 힌디어, 네덜란드어, 체코어, 우르두어, 필리핀어, 스웨덴어, 덴마크어, 히브리어, 아이슬란드어, 말레이어, 노르웨이어, 페르시아어 |
DashScope API를 통한 모델 사용법
블로그는 다음 기능을 갖춘 완전한 Python 클라이언트를 제공합니다:
wss://{workspace_id}.cn-beijing.maas.aliyuncs.com/api-ws/v1/realtime?model=qwen3.8-livetranslate-flash-realtime에 WebSocket을 열기.- 세션을 구성하여 텍스트 및 선택적 음성 출력을 요청하고, 화자 ID와 원문 언어 ASR을 활성화하기.
- 마이크의 PCM 청크(16kHz, 16비트)를 서버로 스트리밍하기.
- 증분 번역 텍스트, 합성된 음성, 화자 식별자를 수신하기.
audio_enabled가 true일 경우 백그라운드 스레드에서 합성된 음성을 재생하기.
핵심 코드 조각 (요약 목적):
config = {
"session": {
"output_modalities": ["text", "audio"] if self.audio_enabled else ["text"],
"input_audio_format": "pcm",
"output_audio_format": "pcm",
"translation": {"language": self.target_language}
}
}
await self.ws.send(json.dumps(config))
클라이언트는 response.audio.delta, response.text.delta, session.finished와 같은 이벤트를 처리하여 실시간 번역을 제공하고 정상 종료를 수행합니다.
시연
블로그는 서유기에서 가져온 두 개의 대화와 동음이의어 예시 세트를 시연하여 다음과 같은 기능을 보여줍니다:
- 대화 전환에 걸쳐 정확한 화자 할당과 안정적인 음성 클로닝.
- 동기화된 이중 언어 화면 출력.
- 시각적 단서를 활용한 맥락 인식 기반의 모호한 용어 해석.
향후 방향
Qwen은 세 가지 연구 우선순위를 제시합니다:
- 지연 시간 압축 – 동시 통역의 이론적 한계에 가까운 엔드투엔드 지연 시간을 달성하기.
- 세션 간 장기 기억 – 동일한 프로젝트 및 참여자에 대해 여러 세션 간 대화 맥락을 유지하기.
- 언어 커버리지 확장 – 보다 많은 장꼬리 언어와 지역 방언을 추가하여 보편적인 실시간 통역 달성하기.
인용
연구나 제품에서 Qwen3.8‑LiveTranslate를 사용할 경우, 다음처럼 블로그 항목을 인용하세요:
@misc{qwen38livetranslateblog,
title = {Qwen3.8-LiveTranslate: Names the speaker. Carries the meaning.},
url = {https://qwen.ai/blog?id=qwen3.8-livetranslate},
author = {Qwen Team},
month = {September},
year = {2026}
}
모든 진술은 2026년 9월 18일자 Qwen 블로그 게시물에서 직접 인용되었습니다.