Gemini 3.5 Live Translate 출시 노트
Gemini 3.5 Live Translate 출시 노트
Google DeepMind은 70개 이상의 언어에 대해 거의 실시간 음성-음성 번역을 위한 새로운 오디오 모델인 Gemini 3.5 Live Translate를 도입했습니다. 이 모델은 전통적인 턴별 번역 시스템에서 지속적인 생성 방식으로 전환하여 어색한 정지를 줄이고 화자와 몇 초 차이만 나는 유동적인 대화 흐름을 유지합니다.
연속 음성-음성 번역
Gemini 3.5 Live Translate은 충분한 컨텍스트를待って 품질을 보장하고 화자와 동기화를 유지하기 위해 즉시 번역하는 사이의 트레이드오프를 균형 있게 맞추어 유연하고 자연스러운 번역 음성을 제공합니다. 주요 기술 기능은 다음과 같습니다:
- 프로소디 보존: 모델은 번역 중에 원래 화자의 억양, 속도, 피치를 유지합니다.
- 자동 언어 감지: 수동 구성 없이 70개 이상의 언어를 자동으로 감지합니다.
- 소음 내구성: 모델은 시끄럽고 예측 불가능한 환경에서 작동하도록 설계되어 실제 응용에 적합합니다.
통합 및 가용성
Gemini 3.5 Live Translate은 다양한 사용자 세그먼트를 위해 여러 플랫폼에 배포되고 있습니다:
- 개발자: Gemini Live API 및 Google AI Studio를 통해 공개 프리뷰로 제공됩니다.
- 기업: 이번 달에 선정된 비즈니스 Google Workspace 고객을 위한 Google Meet에서 비공개 프리뷰가 시작됩니다.
- 일반 사용자: Android 및 iOS용 Google Translate 앱을 통해 전 세계적으로 점진적으로 출시됩니다.
Google Meet 향상 기능
Google Meet에 Gemini 3.5 Live Translate을 통합하면 플랫폼의 번역 기능이 크게 확장됩니다. 이 업데이트는 지원 언어 수를 5개에서 70개 이상으로 늘리고, 영어만 가능한 쌍에서 단일 회의 내 2,000개 이상의 언어 조합으로 번역 조합을 확장합니다.
모바일 경험 및 듣기 모드
Google Translate 모바일 앱에서 사용자는 헤드폰을 사용하여 화자의 톤을 반영하는 원활한 경험을 할 수 있습니다. Android 사용자는 특별히 새로운 '듣기 모드'를 받는데, 이는 번역된 오디오가 전화기의 이어피스를 통해 직접 스트리밍되도록 하여 헤드폰 없이도 라이브 음성(예: 가이드 투어)의 개인 번역을 가능하게 합니다.
개발자 생태계 및 실제 사용 사례
개발자는 Agora, Fishjam, LiveKit, Pipecat, Vision Agents과 같은 인프라 파트너들의 지원을 받는 Gemini Live API를 사용하여 음성 번역 앱을 구축할 수 있습니다.
실제 세계 테스트가 Grab과 함께 이미 진행 중이며, Grab은 픽업 중에 운전자와 여행자 간의 거의 실시간 통신을 촉진하기 위해 이 모델을 테스트하고 있습니다. 이는 월간 1,000만 건 이상의 음성 통화를 처리하는 서비스에 영향을 미칩니다.
안전 및 워터마킹
오류 정보를 방지하기 위해 Gemini 3.5 Live Translate이 생성하는 모든 오디오는 SynthID를 사용하여 워터마크됩니다. 이 알아채기 어려운 워터마크는 오디오 출력에 직접 통합되어 AI 생성 콘텐츠가 감지 가능하도록 유지됩니다.