Gemini 3.5 Flash Cyber 릴리스 노트

Gemini 3.5 Flash Cyber 릴리스 노트

Google DeepMind은 Gemini 3.5 Flash Cyber를 출시했습니다. 이 모델은 소프트웨어 취약점을 찾고, 검증하고, 패치하기 위해 특별히 파인튜닝된 경량 모델입니다. 원본 모델 크기보다 효율성과 속도를 우선시함으로써, 이 모델은 더 크고 비용이 많이 드는 모델로는 불가능한 것보다 더 큰 코드베이스를 스캔하고 더 많은 실행 경로를 더 빠르게 분석할 수 있게 합니다.

고효율 취약점 발견

Gemini 3.5 Flash Cyber는 코드 보안에서의 '탐색 공간 문제'를 해결합니다. 여기서 깊이 숨겨진 결함을 찾으려면 엄청난 수의 실행 경로를 탐색해야 합니다. 이 모델은 경량이며 비용 효율적이므로, CodeMender와 같은 에이전트가 단일 고품질 보고서를 생성하기 전에vastly 더 많은 코드 경로를 분석하기 위해 여러 번 호출할 수 있습니다.

이 아키텍처는 모델을 다음과 같은 곳에 통합할 수 있게 합니다:

  • 빈번한 보안 스캔
  • 시간에 민감한 출시 프로세스
  • 규모를 갖춘 커밋 스캔 파이프라인

성능 벤치마크

Gemini 3.5 Flash Cyber는 여러 전문 평가에서 더 큰 모델과 경쟁력 있는 성능을 보여줍니다:

CyberGym 벤치마크

CyberGym 벤치마크에서(실제 소프트웨어 취약점에 대한 AI 에이전트를 평가하는), 단일 보고서를 위해 3.5 Flash Cyber를 최대 5번 호출하도록 구성된 CodeMender는 훨씬 더 큰 모델과 경쟁력 있는 성능을 달성했습니다.

Big Sleep 평가

Chrome과 Safari와 같은 복잡한 코드베이스의 critical한 취약점에 초점을 맞춘 Google의 Big Sleep 팀의 독립 평가에서, 3.5 Flash Cyber는 메인라인 3.5 Flash 및 3.6 Flash 모델의 성능을 상당히 초과했습니다.

Chrome 프로덕션 커밋 스캔

Google Chrome의 프로덕션 커밋 스캔 파이프라인 테스트에서, 3.5 Flash Cyber는 3.5 Flash에 비해 상당한 향상을 보였습니다. 보고서에 따르면, 더 recientes 경쟁 모델(Opus 4.6 이후)은 내장된 안전 가드레일로 인해 작업을 거부했습니다.

V8 JavaScript 엔진 테스트

V8 JavaScript 엔진에서 테스트한 결과, 3.5 Flash Cyber는 고정된 호출 횟수에서 55개의 고유한 확인된 문제를 발견했으며, 이는 메인라인 3.5 Flash가 발견한 47개 및 Claude Opus 4.6이 발견한 36개보다 많습니다. 여기에는 다른 두 모델이 모두 식별하지 못한 10개의 문제도 포함됩니다.

실제 세계 응용 및 배포

Gemini 3.5 Flash Cyber는 이미 Android, Chrome, Cloud, Ads, YouTube 등을 포함한 Google 내부 코드베이스에서 사용되고 있습니다.

한 사례에서, Google의 Cloud Vulnerability Research 팀은 해당 모델을 사용하여 2시간 이내에 공개 API의 원격 코드 실행 취약점과 민감한 프로덕션 서비스의 메모리 손상 취약점을 발견했습니다. 이후 모델은 Address Space Layout Randomization (ASLR)과 Write XOR Execute (W^X)와 같은 표준 완화 조치를 우회하는 100% 신뢰할 수 있는 원격 코드 실행 익스플로잇을 생성했습니다.

접근 및 가용성

기술의 이중 사용 특성으로 인해, Google은 제한된 접근 파일럿 프로그램을 통해 3.5 Flash Cyber를 배포하고 있습니다. 이는 CodeMender를 통해 정부 및 신뢰할 수 있는 파트너에게 독점적으로 제공될 것입니다.

별도로, CodeMender의 기본 기능은 Gemini Enterprise Agent Platform을 통해 고객에게 일반적으로 제공되고 있습니다.

Sources