Gemini 3 Pro 릴리스 노트
Google DeepMind은 에이전트 워크플로우와 복잡한 제로샷 작업을 향상시키기 위해 설계된 고지능 모델인 Gemini 3 Pro를 도입했습니다. Gemini 3 Pro는 모든 주요 AI 벤치마크에서 이전 버전을 능가하며, 특히 코딩과 추론 능력에서 Gemini 2.5 Pro를 뛰어넘습니다.
에이전트 코딩 및 개발 도구
Gemini 3 Pro는 에이전트 코딩의 기초가 되며, 터미널을 통해 컴퓨터를 조작하는 모델의 능력을 측정하는 Terminal-Bench 2.0에서 54.2% 점수를 보여줍니다. 이 모델은 Android Studio, Gemini CLI, Cursor, GitHub, JetBrains, Manus, Cline과 같은 여러 개발 도구에 통합되었습니다.
Google Antigravity
Google Antigravity는 개발자가 아키텍트 역할을 하면서 작업 공간 전반에 걸쳐 자율 에이전트를 관리할 수 있도록 하는 새로운 에이전트 개발 플랫폼입니다. 이러한 에이전트는 편집기, 터미널, 브라우저에서 작동하여 복잡한 소프트웨어 작업을 계획하고 실행하며, 상세한 아티팩트를 통해 진행 상황을 전달합니다. 이 플랫폼은 MacOS, Windows, Linux용 공개 프리뷰로 제공됩니다.
Gemini API 향상
에이전트 워크플로우를 지원하기 위해 Gemini API에 새로운 도구가 추가되었습니다:
- Bash Tools: 클라이언트 측 bash 도구는 로컬 파일 시스템 탐색 및 시스템 자동화를 위한 셸 명령을 모델이 제안할 수 있게 합니다. 호스팅된 서버 측 bash 도구도 안전 프로토타이핑 및 다중 언어 코드 생성을 위해 제공됩니다.
- Structured Outputs: Google Search 및 URL 컨텍스트와의 Grounding이 이제 구조화된 출력과 결합될 수 있어, 후속 에이전트 작업을 위한 특정 형식으로 데이터 추출을 용이하게 합니다.
바이브 코딩 및 빠른 프로토타이핑
Gemini 3 Pro는 자연어가 애플리케이션 개발의 주요 구문인 '바이브 코딩'을 가능하게 합니다. 이 모델은 WebDev Arena 리더보드에서 1487 Elo 점수를 획득하여, 단일 프롬프트를 통해 고급 아이디어를 인터랙티브한 애플리케이션으로 변환하는 능력을 반영합니다.
Google AI Studio 빌드 모드
Google AI Studio의 빌드 모드는 모델과 API를 자동으로 연결하여 개발자가 프롬프트에서 AI 네이티브 앱으로 빠르게 이동할 수 있게 합니다. 모델의 향상된 지시 사항 따르기 기능으로 단일 프롬프트, 음성 메모, 또는 낙서 스케치로부터 레트로 게임이나 인터랙티브 랜딩 페이지와 같은 완전 기능 앱을 만들 수 있습니다.
멀티모달 이해 및 공간 추론
Gemini 3 Pro는 복잡한 멀티모달 이해를 위한 선도적인 모델로 자리매김하며, MMMU-Pro(이미지 추론)와 Video MMMU(비디오 이해)에서 새로운 벤치마크를 설정합니다. 1백만 토컨 컨텍스트 윈도우를 특징으로 합니다.
시각 및 공간 추론
- Document Understanding: 모델은 OCR을 넘어 복잡한 문서에 대한 지능적인 추론을 제공합니다.
- Spatial Understanding: Gemini 3 Pro는 trajectory prediction 및 pointing과 같은 구체화된 추론 작업에서 뛰어납니다. 이는 자율 주행 차량, 로봇, XR 장치에 적용 가능합니다.
- Screen Understanding: 모델은 마우스 움직임과 화면 주석에서 유도된 사용자 의도를 포함하여 데스크톱 및 모바일 OS 화면을 해석하여 컴퓨터 사용 에이전트를 구동할 수 있습니다.
비디오 추론
Gemini 3 Pro는 빠른 동작을 포착하기 위해 높은 프레임 레이트 이해를 지원하며, 장시간 컨텍스트 회상을 활용하여 몇 시간 분량의 영상에서 내러티브를 합성합니다. OpusClip의 CTO인 Jay Wu에 따르면, 이 모델은 비디오 에이전트 추론 및 도구 호출에 대해 이전 구현 대비 32% 속도 향상을 제공합니다.
기술 사양 및 가용성
Gemini 3 Pro는 기업용 Google AI Studio 및 Vertex AI에서 Gemini API를 통해 프리뷰로 제공됩니다.
200k 토컨 이하 프롬프트에 대한 가격:
- Input: 백만 토컨당 $2
- Output: 백만 토컨당 $12
API 컨트롤: 더 깊은 추론을 지원하기 위해 API에 새로운 사고 수준 파라미터, 멀티모달 비전 처리를 위한 세밀한 미디어 해상도 설정, 그리고 다중 턴 대화 전반에 걸쳐 컨텍스트를 유지하기 위한 사고 서명의 엄격한 검증이 포함되었습니다.
Sources
- OriginalStart building with Gemini 3