Gemini 3.8 Live 및 3.8 Live Extended Thinking 출시
Google은 실시간에 가까운 추론과 직관적인 음성 상호작용에 최적화된 두 가지 새로운 모델인 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking을 출시했습니다. 이 모델들은 개발자와 기업 사용자를 대상으로 음성을 통해 더욱 유연하고 협력적인 대화와 복잡한 작업 수행이 가능하도록 설계되었습니다.
고성능 음성 추론 및 벤치마크
Gemini 3.8 Live Extended Thinking은 복잡한 워크플로우를 위한 고지능 모델로 자리매김했습니다. 현재 Artificial Analysis의 Speech to Speech Quality Index에서 82.6점으로 1위를 차지하고 있습니다. 에이전트 작업 완료 측면에서는 $\tau$-Voice에서 68.6%, Sierra의 $\tau$-Voice-banking 벤치마크에서 35.1%를 기록했습니다. 또한 Big Bench Audio에서는 97.7%의 점수를 받았습니다.
Gemini 3.8 Live는 확장성과 비용 효율성을 위해 설계되었으며, Speech Agent Arena에서 2위를 차지했습니다. 두 모델 모두 정확성과 대화 품질 사이의 균형을 맞추는 능력으로 주목받고 있으며, 복잡한 워크플로우를 위한 ServiceNow의 EVA-Bench에서 파레토 최적(Pareto Frontier)을 확장하고 있습니다.
주요 기술적 역량
실시간 멀티모달 통합
Gemini 3.8 Live는 시각적 입력을 실시간에 가깝게 처리하여 모델이 시각적 맥락에 기반한 대화를 나눌 수 있도록 합니다. 대화 도중 지원되는 97개 언어 간의 자동 감지 및 전환을 지원합니다.
병렬 실행 및 추론
Gemini 3.8 Live는 지속적인 대화를 유지하면서 백그라운드에서 도구 및 API 호출을 실행할 수 있습니다. Gemini 3.8 Live Extended Thinking은 이를 한 단계 더 발전시켜 추론과 발화를 동시에 수행합니다. 이 모델은 자연스러운 언어적 신호(예: "확인해 보겠습니다...")와 실시간 진행 상황 설명을 사용하여 대화 흐름을 방해하지 않으면서 다단계 백그라운드 작업 중에 사용자에게 정보를 제공합니다.
개발자 및 기업 생태계
Google은 Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents를 포함한 개발자 플랫폼과 통합된 Gemini Live API를 통해 이러한 모델을 제공하고 있습니다. 이러한 플랫폼은 실시간 미디어 스트리밍 인프라를 처리하여 개발자가 사용자 경험에 집중할 수 있도록 합니다.
Salesforce, Genspark, Lumeris와 같은 기업 파트너들은 이미 낮은 지연 시간과 강력한 도구 호출 기능을 이유로 이 모델들을 활용하기 시작했습니다.
안전성 및 가용성
오정보를 방지하기 위해 이 모델들이 생성하는 모든 오디오에는 오디오 출력에 직접 삽입되는 감지 불가능한 워터마크인 SynthID가 적용됩니다.
가용성 출시 정보:
- Gemini 3.8 Live: Gemini API 및 Google AI Studio를 통해 개발자에게 제공되며, Gemini Enterprise에서는 비공개 미리보기로, Search Live에서는 모든 사용자에게 제공됩니다.
- Gemini 3.8 Live Extended Thinking: Gemini API 및 Google AI Studio를 통해 개발자에게 제공되며, Gemini Enterprise 및 Google Workspace 비즈니스 고객에게는 비공개 미리보기로, Workspace(Docs)의 Google AI Pro 및 Ultra 구독자와 Gmail 및 Keep의 모든 Google AI 구독자에게 제공됩니다.
커뮤니티 피드백 및 사용자 통찰
이번 출시에 대한 사용자 반응은 엇갈리고 있으며, 실제 적용 사례에서 모델의 강점과 약점이 모두 드러나고 있습니다.
강점
- 언어 지원: 사용자는 틈새 언어를 처리하는 모델의 능력을 칭찬했으며, 한 사용자는 "[아프리칸스어]를 구사하는 능력이 경이롭다"고 언급하며 희귀 언어에 대한 가치 있는 대화 파트너라고 평가했습니다.
- 사용자 경험: 일부 사용자는 낮은 지연 시간과 두꺼운 억양도 잘 처리하는 쾌적하고 사실적인 음성을 보고했습니다.
약점 및 우려 사항
- 환각 및 신뢰성: 일부 개발자들은 에이전트 시나리오에서 모델이 "더 멍청해질" 수 있으며, 존재하지 않는 추가 요구 사항과 구현 세부 정보를 지어낸다고 보고했습니다.
- 추론 깊이: "Extended Thinking"이라는 브랜딩에 대해 회의적인 시각이 있으며, 한 사용자는 일부 경우에 잘못된 답변이 지나치게 많다는 이유로 "약간 확장된 생각(Slightly Extended Thinking)"으로 이름을 바꿔야 한다고 제안했습니다.
- 기술적 문제: 모델이 스스로에게 답변하는 무한 루프에 빠지거나 무작위로 언어를 전환한다는 보고가 있었습니다.
- 제품 통합: 사용자는 버전의 일관되지 않은 출시(예: 일부 사용자는 여전히 3.6 Flash를 보고 있음)와 전화 통화 통합을 위한 SIP(Session Initiation Protocol) 지원 부족에 대해 불만을 표출했습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch