Gemini 3.1 Flash TTS 출시 노트 / 새로운 기능

Gemini 3.1 Flash TTS 출시 노트 / 새로운 기능

Google DeepMind은 더 높은 표현력, 향상된 자연스러움, 세밀한 제어성을 위해 설계된 차세대 텍스트-음성(TTS) 모델인 Gemini 3.1 Flash TTS를 도입했습니다. 이 모델은 개발자를 위해 Gemini API 및 Google AI Studio를 통해 프리뷰로 제공되며, 기업은 Vertex AI를 통해, Workspace 사용자는 Google Vids를 통해 이용할 수 있습니다.

고충실도 음성 품질 및 성능

Gemini 3.1 Flash TTS는 현재까지 Google에서 가장 자연스럽고 표현력이 풍부한 TTS 모델로 positioning됩니다. aveug human preference testing을 사용하는 Artificial Analysis TTS 리더보드에 따르면, 이 모델은 Elo 점수 1,211을 달성했습니다.

Artificial Analysis는 또한 Gemini 3.1 Flash TTS를 "가장 매력적인 사분면"에 분류하며, 고품질 음성 생성과 낮은 운영 비용 사이의 최적 균형을 언급했습니다. 주요 기능으로는 네이티브 멀티스피커 대화 및 70개 이상의 언어 지원이 포함됩니다.

자연어 오디오 태그를 통한 세밀한 제어

Gemini 3.1 Flash TTS의 정의 특징은 오디오 태그의 도입입니다. 이를 통해 사용자는 텍스트 입력에 자연어 명령을 직접 삽입하여 AI 음성의 vocal style, pace, delivery를 조절할 수 있습니다.

개발자에게 "감독 의자" 경험을 제공하기 위해, Google AI Studio에는 여러 가지 구성 가능한 컨트롤이 포함되어 있습니다:

  • Scene Direction: 사용자는 환경을 정의하고 대화 지침을 제공하여 캐릭터가 여러 차례의 대화에서 일관성을 유지하고 자연스럽게 반응하도록 할 수 있습니다.
  • Speaker-Level Specificity: 개발자는 캐릭터에 고유한 Audio Profiles를 할당하고, "Director's Notes"를 사용하여 tone, accent, pace를 조정할 수 있습니다. 인라인 태그를 통해 화자는 문장 중간에 표현을 변경할 수 있습니다.
  • Seamless Export: 스튜디오에서 vocal performance가 최종화되면, 매개변수를 Gemini API 코드로 내보내어 다양한 플랫폼과 프로젝트에서 음성 일관성을 유지할 수 있습니다.

글로벌 확장성 및 언어 지원

Gemini 3.1 Flash TTS는 글로벌 배포에 최적화되어 70개 이상의 언어를 지원합니다.これにより 개발자는 주요 국제 시장에서 고급 스타일, 악센트, 페이스 컨트롤을 구현하여 현지화되고 표현력 있는 오디오 경험을 대규모로 만들 수 있습니다.

AI 안전 및 SynthID 워터마킹

오보를 방지하고 AI 생성 콘텐츠의 신뢰할 수 있는 탐지를 보장하기 위해, Gemini 3.1 Flash TTS가 생성하는 모든 오디오는 SynthID를 사용하여 워터마킹됩니다. 이 워터마크는 인간 귀로는 감지할 수 없지만, 검증 목적으로 오디오 출력에 직접 결합됩니다.

Sources