Gemini 3.8 Flash 및 3.8 Flash Cyber 출시

Google DeepMind는 에이전트 워크플로우와 사이버 보안을 강화하기 위해 설계된 두 가지 모델인 Gemini 3.8 Flash 및 Gemini 3.8 Flash Cyber를 출시했습니다. 두 모델 모두 모델 출력을 재귀적으로 평가하고 개선하는 장기 실행 에이전트 루프에 의해 가속화된 기초 지능 코어를 공유하며, 사이버 보안에 대한 엄격한 훈련을 통해 상당한 성능 향상을 이루었습니다.

Gemini 3.8 Flash: 향상된 추론 및 에이전트 워크플로우

Gemini 3.8 Flash는 소프트웨어 엔지니어링, 에이전트 작업 및 다단계 추론 분야에서 3.7 Flash를 개선한 고지능 "워크호스(workhorse)" 모델로 자리매김하고 있습니다. 3.7 Flash와 동일한 도입 가격을 유지합니다: 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75.

소프트웨어 엔지니어링 및 전문 분야에서의 성능

Gemini 3.8 Flash는 여러 주요 벤치마크에서 더 높은 비용의 프론티어 모델에 근접하는 성능을 보여줍니다:

  • Long-Horizon Software Engineering: DeepSWE v1.1 벤치마크에서 3.8 Flash는 복잡한 엔지니어링 문제를 엔드투엔드로 해결하는 데 있어 대부분의 더 큰 프론티어 모델보다 뛰어난 성능을 보입니다.
  • Specialized Knowledge Domains: 이 모델은 Vals Finance Agent V2 및 Harvey's Legal Agent Benchmark에서 3.7 Flash 및 기타 프론티어 모델을 능가합니다.
  • Multi-step Reasoning: 3.8 Flash는 STEM, 인문학 및 전문 분야를 아우르는 HLE-Verified에서 54.9%의 점수를 기록했습니다.

운영 로직 및 효율성

성능 향상은 모델이 복잡한 작업에 대해 추가적인 추론 단계를 실행하고 도구를 반복적으로 호출하는 핵심 설계 방식 덕분입니다. 이러한 철저함은 더 높은 노력 수준에서 더 많은 토큰 사용량을 초래할 수 있지만, 개발자는 더 낮은 노력 수준을 선택하거나 효율성 우선 워크플로우를 위해 Gemini 3.7 Flash를 계속 사용할 수 있습니다.

Gemini 3.8 Flash Cyber: 특화된 사이버 보안 역량

Gemini 3.8 Flash Cyber는 취약점 탐지 및 자동 패치 작업을 위해 설계된 특화 모델입니다. Fairwind Program을 통해 신뢰할 수 있는 방어자들에게만 독점적으로 제공됩니다.

취약점 발견

Gemini 3.8 Flash Cyber는 자율적인 취약점 발견 분야에서 프론티어 수준의 성능을 보여줍니다:

  • CyberGym Benchmark: 이 모델은 3.5 Flash Cyber 및 더 큰 프론티어 모델을 모두 능가합니다.
  • Multi-language Discovery: 20개의 프로그래밍 언어를 아우르는 내부 벤치마크에서, 이 모델은 70% 이상의 성공률을 달성했습니다.

자동 패치

Google DeepMind는 공격적인 착취 능력보다는 취약점 수정 능력을 우선시했습니다. Collinear이 운영하는 CWE-Bench에서, Gemini 3.8 Flash Cyber는 pass@1 47.2%를 기록하며 파레토 프론티어(Pareto frontier)에 위치하며, 훨씬 낮은 비용으로 선도적인 프론티어 모델(47.8%)과 거의 대등한 성능을 보여줍니다.

실제 적용 사례 및 영향

Gemini 3.8 Flash Cyber는 여러 고영향 시나리오에 배치되었습니다:

  • Chrome Security: 이 모델은 더 큰 상용 모델보다 Chrome 취약점에 대해 2.6배 더 많은 정확한 패치를 생성했습니다.
  • Wiz Penetration Testing: Wiz는 다른 선도적인 프론티어 모델보다 2.3-5.2배 낮은 비용으로 내부 침투 테스트 벤치마크에서 7.5-9.7% 더 높은 재현율(recall)을 보고했습니다.
  • Google Cloud Vulnerability Research: 이 모델은 일반적으로 수개월이 걸리는 과정을 단 두 시간 만에 치명적인 기초 취약점을 식별별했습니다.

안전 및 견고성

두 모델 모두 Frontier Safety Framework에 따라 사이버 공격 및 화학, 생물학, 방사능 및 핵(CBRN) 분야에서의 오용용을 방지하기 위한 안전 장치를 포함하고 있습니다. Gemini 3.8 Flash Cyber는 더 포괄적인 사이버 역량을 요구하기 때문에, 더 허용적인 완화 조치를와 함께 출시되며 신뢰할 수 있는 방어자들에게만 제한됩니다.

또한, Gemini 3.8 모델은 Gray Swan IPI 벤치마크로 측정된 프롬프트 인젝션 공격에 대한 향상된 견고성을 보여줍니다.

가용성

  • Developers: Google AI Studio, Android Studio, 및 Gemini API를 통해 이용 가능합니다. 에이전트 우선 워크플로우는 Google Antigravity에서, UI 생성은 Stitch에서 탐색할 수 있습니다.

  • Enterprises: Gemini Enterprise를 통해 이용 가능합니다.

  • Consumers: Gemini 앱, Google Search의 AI Mode, 및 Google Sheets의 Gemini를 통해 Google AI Pro 및 Ultra 구독자에게 제공됩니다.

  • Cybersecurity Professionals: Gemini 3.8 Flash Cyber에 대한 액세스는 정부 기관, 핵심 인프라 운영자 및 소프트웨어 유지 관리자를 위한 Fairwind Program을 통해 관리됩니다.

Sources