Gemini 3.1 Flash Live 릴리스 노트 / 새로운 소식
Google DeepMind는 Gemini 3.1 Flash Live를 발표했습니다. 이는 현재까지 출시된 가장 높은 품질의 오디오 및 음성 모델이며, 지연 시간을 줄이고 음향 뉘앙스를 이해하는 능력을 향상시켜 보다 유연하고 자연스러우며 정밀한 실시간 대화를 가능하게 합니다.
기술 성능 및 벤치마크
Gemini 3.1 Flash Live는 음성 우선 에이전트를 위한 추론 및 작업 수행 능력에서 큰 개선을 보여줍니다. 이 모델은 여러 주요 오디오 벤치마크에서 선두를 차지합니다:
- ComplexFuncBench Audio: 모델은 90.8% 점수를 달성했으며, 다양한 제약 조건을 가진 다단계 함수 호출에서 선두를 차지했습니다.
- Audio MultiChallenge (Scale AI): "thinking"을 활성화한 상태에서 모델은 36.1% 점수를 달성했으며, 실제 오디오 중단 및 머뭇거림 상황에서 복잡한 지시 수행 및 장기 추론 테스트에서 선두를 차지했습니다.
향상된 오디오 기능
모델은 톤 이해와 음향 민감도가 향상되어 보다 자연스러운 상호작용을 가능하게 합니다:
- Tonal Recognition: Gemini 3.1 Flash Live는 이전 2.5 Flash Native Audio 모델보다 음높이와 속도를 인식하는 데 더 효과적입니다.
- Dynamic Response: 모델은 사용자의 좌절감이나 혼란 표현에 따라 응답을 동적으로 조정할 수 있습니다.
- Environmental Robustness: 모델은 소음이 많은 환경에서도 복잡한 작업을 처리하도록 설계되었습니다.
제품 통합 및 제공
Gemini 3.1 Flash Live는 다양한 Google 플랫폼에 통합되어 여러 사용자 세그먼트를 대상으로 제공합니다:
- Developers: Google AI Studio의 Gemini Live API를 통해 프리뷰 형태로 제공됩니다.
- Enterprises: 고객 경험을 위한 Gemini Enterprise를 통해 제공됩니다.
- General Users: Search Live와 Gemini Live에 통합되었습니다.
사용자 경험 개선
최종 사용자에게 3.1 Flash Live 모델은 보다 직관적인 상호작용 경험을 제공합니다:
- Faster Responses: Gemini Live는 이전 버전보다 더 빠른 응답을 제공합니다.
- Extended Context: 모델은 대화 흐름을 두 배 더 오래 따라갈 수 있어, 긴 브레인스토밍 세션의 연속성을 향상시킵니다.
- Global Expansion: 모델 고유의 다국어 지원 덕분에 Search Live는 200개 이상의 국가와 지역으로 확대되어, 선호하는 언어로 실시간 멀티모달 대화를 가능하게 합니다.
안전 및 책임
오정보 확산을 방지하기 위해 Gemini 3.1 Flash Live가 생성하는 모든 오디오는 SynthID를 사용해 워터마크가 삽입됩니다. 이 눈에 띄지 않는 워터마크는 오디오 출력에 직접 삽입되어 AI 생성 콘텐츠를 신뢰성 있게 감지할 수 있도록 합니다.