Gemini 3.8 Flash 및 3.8 Flash Cyber 릴리스 노트
Google는 3.7 Flash 버전의 속도와 저비용을 유지하면서도 고급 추론 및 코딩 능력을 제공하는 에이전트 워크플로우 및 사이버보안 분야에 특화된 Gemini 3.8 Flash와 Gemini 3.8 Flash Cyber를 출시했습니다. 이는 6주 만에 세 번째 Flash 릴리스입니다.
Gemini 3.8 Flash: 고급 추론 및 에이전트 워크플로우
Gemini 3.8 Flash는 고지능 '작업용 모델'로, 소프트웨어 공학 및 전문 분야에서 큰 성과를 보여줍니다. 입력 토큰 100만 개당 가격은 0.75달러, 출력 토큰 100만 개당 가격은 3.75달러입니다.
장기적 소프트웨어 공학
장기적 소프트웨어 공학을 위한 DeepSWE v1.1 벤치마크에서 3.8 Flash는 복잡한 공학 문제를 자율적으로 끝까지 해결하는 데 있어 대부분의 더 큰 프론트라인 모델을 능가합니다.
전문 분야 성능
3.8 Flash는 정량적 및 전문 분야에서 높은 신뢰성을 보이며, 다음과 같은 벤치마크에서 3.7 Flash 및 기타 프론트라인 모델을 능가합니다:
- Vals Finance Agent V2: 고급 금융 분석 및 보고서 작성.
- Harvey's Legal Agent Benchmark: 전문적인 법적 추론.
- HLE-Verified: STEM, 인문학, 전문 분야에 걸쳐 다단계 추론을 보여주는 54.9%의 점수를 기록.
설계 철학: 더 높은 신중함
성능 향상은 복잡한 작업에서 더 많은 추론 단계를 수행하고 도구를 반복적으로 호출하는 설계 선택에서 비롯됩니다. 이는 높은 노력 수준에서 토큰 사용량이 증가할 수 있지만, 효율 우선 워크로드의 경우 낮은 노력 수준을 사용하거나 Gemini 3.7 Flash를 유지할 수 있습니다.
Gemini 3.8 Flash Cyber: 전문화된 사이버보안 기능
Gemini 3.8 Flash Cyber는 Fairwind 프로그램을 통해 신뢰할 수 있는 방어자들에게 제공되는 전문화된 모델입니다. 이 모델은 공격적 활용보다는 취약점 수정에 중점을 두는 방어 기능을 강조합니다.
취약점 탐지 및 패치
- 자율적 탐지: CyberGym 벤치마크에서 3.8 Flash Cyber는 3.5 Flash Cyber 및 더 큰 프론트라인 모델을 능가합니다. 내부 벤치마크에서 20개의 프로그래밍 언어를 아우르며 70% 이상의 성공률을 기록했습니다.
- 자동 패치: Collinear이 운영하는 CWE-Bench에서 3.8 Flash Cyber는 pass@1 47.2%를 달성하여 비용 대비 패치 능력에서 파레토 최적 경계에 위치합니다.
Google 내 실제 영향
Google는 내부적으로 3.8 Flash Cyber를 사용하여 자체 코드베이스를 보호하고 있습니다:
- Chrome 보안: 최고의 더 큰 상용 모델보다 2.6배 더 많은 정확한 패치를 생성했습니다.
- 클라우드 취약점 연구: 일반적으로 수개월이 걸리는 작업을 2시간 이내에 핵심 기초 취약점을 식별했습니다.
- Wiz: 다른 프론트라인 모델보다 2.3
5.2배 낮은 비용으로 내부 침투 테스트 벤치마크에서 7.59.7% 더 높은 재현율을 보고했습니다.
안전성 및 강건성
두 모델 모두 화학, 생물, 방사능, 핵(CBRN) 및 사이버 공격에 대한 오용을 방지하는 보호 조치를 포함하고 있습니다. Gemini 3.8 Flash Cyber는 신뢰할 수 있는 방어자가 포괄적인 보안 작업을 수행할 수 있도록 더 유연한 완화 조치를 제공합니다. 또한 3.8 시리즈는 Gray Swan IPI 벤치마크를 통해 프롬프트 주입에 대한 강건성에서 큰 향상을 보였습니다.
커뮤니티 인사이트 및 기술적 논의
Hacker News에서의 사용자 피드백은 모델의 속도와 특정 작업에서의 유용성에 대한 높은 찬사를 받는 동시에 일관성과 가용성에 대한 우려를 함께 나타냅니다.
강점
- 다중 모달성: 사용자들은 Gemini가 경쟁사보다 오디오 및 비디오 입력 지원이 탁월하다고 강조하며, 미디어 분석 및 비디오에서 구조화된 데이터 추출에 이상적이라고 평가합니다.
- 문체 및 행동 지향성: 일부 사용자는 Claude 시리즈보다 Gemini의 문체가 더 직접적이고 '사용 가능한 간결함'을 지녔다고 느끼며, 행동 중심이라고 평가합니다.
- uma 문서 추출: 한 사용자는 신뢰성과 비용 효율성으로 인해 Gemini Flash를 클라이언트 문서 추출 워크플로우의 주요 모델로 사용하고 있다고 보고했습니다.
- 특정 작업 성공 사례: 3D 프린팅을 위한 CAD 작업 및 중국어 논리적 에세이 작성 등에서 성공적인 사용 사례가 보고되었습니다.
비판 및 제한 사항
- 코딩 신뢰성: 벤치마크 점수는 높지만, 일부 사용자는 모델이 코딩에서 '무모하게' 행동하며, Opus 모델보다 복잡한 코드 리뷰에서 실패하거나 작동하지 않는 코드를 생성한다고 보고했습니다.
- 지연 및 토큰 효율성: 일부 사용자는 3.8 Flash가 3.7 Flash보다 토큰 효율성이 낮아, 높은 토큰/초(TPS)에도 불구하고 전체 응답 속도가 느릴 수 있다고 관찰했습니다.
- 가용성: 사용자들은 Gemini 웹 인터페이스로의 모델 롤아웃 속도가 느리며, 최신 릴리스 대신 오래된 버전(예: 3.6 Flash)이 자주 사용 가능하다는 점에 실망을 표했습니다.
- 지식 절단 시점: Gemini 3.8 Flash의 지식 절단 시점은 2026년 3월이지만, 일부 분야는 여전히 2025년 1월까지 제한됩니다.
"Gemini 모델의 가장 흥미로운 점은 여전히 다중 모달 지원입니다: 오디오와 비디오 입력을 허용합니다. OpenAI와 Anthropic의 주력 모델은 여전히 이미지만 지원합니다."
"저는 Claude의 장황함과 TED 강연 스타일의 표현에 대해 여기서 여러 차례 불만을 제기했지만, 대비적으로 Gemini는 문체 측면에서 Claude가 꿈꾸던 최종 상태에 이미 도달한 것 같습니다."
가용성
- 개발자: Google AI Studio, Android Studio, Google Antigravity, Stitch를 통해 이용 가능.
- 기업: Gemini Enterprise를 통해 이용 가능.
- 소비자: Gemini 앱, Google 검색의 AI 모드, Google 시트의 Gemini를 통해 Google AI Pro 및 Ultra 구독자에게 제공.
- 사이버보안 전문가: 정부 기관 및 핵심 인프라 운영자들을 위한 Fairwind 프로그램을 통해 3.8 Flash Cyber에 접근 가능.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch