Gemini 2.5 Flash Native Audio 출시: 강화된 라이브 음성 에이전트 및 실시간 음성 번역

TL;DR

Google DeepMind는 기능 호출(function calling), 지시 이행(instruction following), 멀티턴 대화 품질을 개선하고 70개 이상의 언어에 대한 실시간 음성 대 음성(speech-to-speech) 번역 기능을 추가한 업그레이드된 라이브 음성 모델인 Gemini 2.5 Flash Native Audio를 출시했습니다.


Gemini 2.5 Flash Native Audio 개요

Gemini 2.5 Flash Native Audio는 DeepMind의 오디오 중심 Gemini 모델의 최신 버전입니다. 라이브 음성 에이전트를 위해 설계되었으며 현재 Google AI Studio, Vertex AI, Gemini Live 및 Search Live를 통해 일반적으로 사용할 수 있습니다. 이번 출시를 통해 모델의 기능이 표현력 있는 텍스트 음성 변환(TTS)을 넘어 강력한 대화 처리 및 실시간 음성 번역을 포함하도록 확장되었습니다.


기술적 개선 사항

더욱 정교해진 기능 호출

  • 모델이 이제 외부 함수를 호출해야 하는 시점을 더 높은 신뢰도로 식별합니다.
  • ComplexFuncBench Audio 평가에서 Gemini 2.5 Flash Native Audio는 **71.5%**의 점수를 기록하며 벤치마크를 선도했습니다.

강력해진 지시 이행

  • 개발자가 제공한 지침 준수율이 이전 버전의 **84%**에서 **90%**로 상승했습니다.
  • 이는 복잡한 프롬프트에 대해 더욱 완전하고 예측 가능한 오디오 출력을 생성함을 의미합니다.

더 매끄러운 멀티턴 대화

  • 대화 턴 전반에 걸친 향상된 문맥 검색을 통해 더욱 응집력 있고 자연스러운 상호작용을 제공합니다.
  • 모델이 응답에 실시간 정보를 통합할 때 사용자는 흐름이 끊기는 현상을 덜 경험하게 됩니다.

라이브 음성 에이전트 활용 사례

이 모델은 Gemini Live에서의 브레인스토밍 세션부터 Search Live에서의 실시간 지원에 이르기까지 다양한 대화 경험을 지원합니다. 기업은 이 모델을 고객 서비스 파이프라인에 통합하여 자연스럽게 들리고, 소음이 있는 환경을 처리하며, 즉석에서 언어를 전환할 수 있는 에이전트를 구현할 수 있습니다.

고객 후기

“사용자들은 Sidekick을 사용한 지 1분도 안 되어 AI와 대화하고 있다는 사실을 잊어버리곤 합니다… Gemini 2.5 Flash Native Audio를 통해 제공되는 새로운 Live API AI 기능은 우리 판매자들이 승리할 수 있도록 돕습니다.” – David Wurtz, Shopify 제품 부사장

“Gemini 2.5 Flash Native Audio 모델을 통합함으로써… Mia의 기능을 크게 향상시켰으며… 우리 브로커 파트너들을 위해 14,000건 이상의 대출을 생성했습니다.” – Jason Bressler, United Wholesale Mortgage CTO

“Vertex AI를 통해 Gemini 2.5 Flash Native Audio 모델을 사용함으로써 Newo.ai AI 접수원이 타의 추종을 불허하는 대화 지능을 달성할 수 있게 되었습니다… 소음이 심한 환경에서도 주요 화자를 식별하고, 대화 도중 언어를 전환하며, 놀라울 정도로 자연스럽고 감정적으로 풍부하게 들립니다.” – David Yang, Newo.ai 공동 창립자


실시간 음성 번역

Gemini는 이제 두 가지 모드로 작동하는 네이티브 실시간 음성 대 음성 번역을 제공합니다:

  • 연속 청취(Continuous Listening) – 주변의 모든 언어 음성을 단일 대상 언어로 번역하여 사용자가 헤드폰을 착용한 채 선호하는 언어로 세상을 들을 수 있게 합니다.
  • 양방향 대화(Two-Way Conversation) – 화자에 따라 출력 언어를 동적으로 전환하여 원활한 이중 언어 대화(예: 영어 ↔ 힌디어)를 가능하게 합니다.

핵심 번역 기능

기능 설명
언어 범위 Gemini의 다국어 지식을 활용하여 70개 이상의 언어와 2,000개의 언어 쌍을 지원합니다.
스타일 전송 억양, 속도 및 피치를 보존하여 번역된 음성이 자연스럽게 들리도록 합니다.
다국어 입력 단일 세션 내에서 여러 소스 언어를 처리합니다.
자동 감지 수동 선택 없이 말하는 언어를 자동으로 감지합니다.
소음 강건성 시끄러운 환경에서도 명확한 번역을 위해 주변 소음을 필터링합니다.

베타 경험은 Google Translate 앱에서 사용할 수 있습니다 (Android는 미국, 멕시코, 인도에서 출시 중; iOS 및 기타 지역은 곧 출시 예정). 피드백은 2026년으로 예정된 Gemini API 출시를 포함한 향후 통합에 반영될 예정입니다.


시작하기

개발자는 다음을 통해 Gemini 2.5 Flash Native Audio를 사용하여 음성 에이전트 구축을 시작할 수 있습니다:

  • Vertex AI – 프로덕션 워크로드를 위한 일반 가용성.
  • Gemini API preview – Gemini API 문서를 통해 액세스 가능.
  • Google AI Studio – 빠른 프로토타이핑을 위한 대화형 플레이그라운드.

Gemini 2.5 Flash 및 Gemini 2.5 Pro 텍스트 음성 변환 모델도 Gemini API를 통해 사용할 수 있으며, 포괄적인 문서, 프롬프트 가이드 및 예제 노트북 쿡북이 제공됩니다.


시사점

이번 출시는 정적인 텍스트 음성 변환에서 완전히 상호작용적인 오디오 우선 AI 경험으로의 전환을 의미합니다. 신뢰할 수 있는 기능 호출, 높은 지시 충실도 및 실시간 다국어 번역을 결합함으로써 Gemini 2.5 Flash Native Audio는 더욱 자연스러운 기업급 음성 에이전트를 가능하게 하고, 특히 시각적 인터페이스를 사용하기 어려운 시나리오에서 글로벌 커뮤니케이션의 새로운 길을 엽니다.


참고 문헌

Sources