제미니 3 릴리스 노트
Google DeepMind은 현재까지 가장 지능적인 모델인 Gemini 3를 도입했습니다. 멀티모달 이해, 고급 추론, 그리고 에이전트형 기능을 통합하여 사용자가 학습하고, 구축하며, 계획할 수 있도록 설계되었습니다. 이번 릴리스에는 Google 제품 전반에서 사용할 수 있는 고성능 모델인 Gemini 3 Pro와, altamente 복잡한 작업을 위한 향상된 추론 모드인 Gemini 3 Deep Think가 포함됩니다.
최첨단 추론 및 벤치마크
Gemini 3 Pro는 모든 주요 AI 벤치마크에서 Gemini 2.5 Pro를 크게 앞지르며, 추론, 수학, 사실 정확성 분야에서 새로운 표준을 수립했습니다.
성능 지표
- 일반 지능: Gemini 3 Pro는 1501 Elo 점수로 LMArena 리더보드의 정상에 올랐습니다.
- 박사 수준 추론: 이 모델은 Humanity’s Last Exam(도구 없이)에서 37.5%, GPQA Diamond에서 91.9%를 달성했습니다.
- 수학: MathArena Apex에서 23.4%를 기록하여 새로운 프론티어 모델 상태의 예술성을 세웠습니다.
- 멀티모달 추론: Gemini 3 Pro는 MMMU-Pro에서 81%, Video-MMMU에서 87.6%를 기록했습니다.
- 사실 정확성: SimpleQA Verified에서 72.1%를 달성했습니다.
Gemini 3 Deep Think
Gemini 3 Deep Think는 추론 경계를 더욱 넓히는 특수 모드입니다. 테스트에서 다음과 같은 성과를 달성했습니다:
- Humanity’s Last Exam: 41.0% (도구 없이).
- GPQA Diamond: 93.8%.
- ARC-AGI-2: 45.1% (코드 실행 포함, ARC Prize Verified), 새로운 문제를 해결할 수 있는 능력을 보여줍니다.
멀티모달 학습 및 검색 통합
Gemini 3는 1백만 토컨텍스트 윈도우와 고급 시각 및 공간 이해를 결합하여 텍스트, 이미지, 비디오, 오디오, 코드 전반의 정보를 종합합니다.
교육 응용
Gemini 3는 여러 언어로 된 손글씨 레시피를 요리책으로 번역하거나, 학술 논문과 긴 비디오 강의를 분석하여 인터랙티브 플래시카드와 시각화를 생성할 수 있습니다. 또한 스포츠 비디오(예: 피클볼)를 분석하여 폼 개선 및 훈련 계획을 제공할 수 있습니다.
검색에서의 AI 모드
처음으로 Gemini가 Google Search에 당일 출시됩니다. 검색에서의 AI 모드는 Gemini 3를 활용하여 사용자 쿼리에 기반하여 실시간으로 생성되는 몰입형 시각 레이아웃과 인터랙티브 시뮬레이션을 포함한 생성형 UI 경험을 만듭니다.
에이전트형 코딩 및 Google Antigravity
Gemini 3는 복잡한 소프트웨어 작업을 자동화하고 개발자 생산성을 높이는 강력한 'vibe coding' 및 에이전트형 모델로 자리매김하고 있습니다.
코딩 벤치마크
- 웹 개발: Gemini 3는 1487 Elo 점수로 WebDev Arena 리더보드의 정상에 올랐습니다.
- 도구 사용: Terminal-Bench 2.0에서 54.2%를 기록했는데, 이는 터미널을 통해 컴퓨터를 조작할 수 있는 능력을 테스트합니다.
- 코딩 에이전트: SWE-bench Verified에서 Gemini 2.5 Pro를 크게 앞질러 76.2%를 기록했습니다.
Google Antigravity
Google은 에이전트 우선 개발 플랫폼인 Google Antigravity를 출시했습니다. 기존 AI IDE와 달리, Antigravity의 에이전트는 편집기, 터미널, 브라우저에 직접 접근하여 엔드투엔드 소프트웨어 작업을 자율적으로 계획, 실행, 검증할 수 있습니다. 이 플랫폼은 Gemini 3 Pro, 브라우저 제어를 위한 Gemini 2.5 Computer Use 모델, 그리고 이미지 편집 모델인 Nano Banana (Gemini 2.5 Image)를 통합합니다.
장기 계획 및 개인 에이전시
Gemini 3 Pro는 더 긴 기간 동안 신뢰성 있게 계획을 세우고 일관된 의사결정을 유지하는 능력을 향상시킵니다.
- Vending-Bench 2: Gemini 3 Pro는 이 리더보드의 정상에 올랐으며, 작업에서 벗어나지 않고 시뮬레이션된 1년 동안의 비즈니스 운영 동안 일관된 도구 사용과 의사결정을 유지합니다.
- 일상적 유용성: 이러한 개선 사항은 Google AI Ultra 구독자에게 제공되는 Gemini Agent를 통해 받은 편지함 정리나 지역 서비스 예약과 같은 다단계 워크플로우를 처리할 수 있도록 모델을 지원합니다.
안전 및 책임
Gemini 3는 현재까지 어떤 Google AI 모델보다 가장 포괄적인 안전 평가를 거쳤습니다. 주요 개선 사항은 다음과 같습니다:
- 과도한 아첨 감소: 모델은 사용자의 말에 단순히 동의할 가능성이 낮아졌습니다.
- 보안: 프롬프트 주입에 대한 저항력이 증가했고 사이버 공격에 대한 보호가 향상되었습니다.
- 외부 검증: 평가는 주제 전문가, UK AISI, 그리고 Apollo, Vaultis, Dreadnode와 같은 독립 기업과의 협력으로 수행되었습니다.