Gemini 4 Argon 전면 모델 발표
TL;DR
Gemini 4 Argon은 Google DeepMind의 최신 전면 모델로, 1 M토큰의 컨텍스트 창을 제공하며 소프트웨어 공학, 기업 지식 업무, 방어적 사이버 보안 분야에서 최첨단 성능을 보여줍니다. 초기에는 Fairwind 프로그램을 통해 신뢰할 수 있는 사이버 방어자들에게 제공됩니다.
Gemini 4 Argon 소개
Gemini 4 Argon은 장기적이고 복잡한 워크플로우에서 깊이 있는 추론을 지속할 수 있도록 설계된 '전면' 모델입니다. 발표는 세 가지 주요 분야에 초점을 맞춥니다:
- 실제 세계의 소프트웨어 공학
- 법률 및 금융과 같은 기업 지식 업무
- 사이버 보안 방어
이 모델은 단계적으로 출시되며, DeepMind가 미국 정부의 자발적 사전 출시 접근 프로세스와 안전 가드레일 개선을 위해 협의하는 동안 신뢰할 수 있는 방어자 코호트에 먼저 제공됩니다.
가격
- 입력 토큰: 100만 단위당 $2
- 출력 토큰: 100만 단위당 $10
- 캐시된 입력 토큰: 입력 가격의 95% 할인
Google 내부 워크플로우에 미치는 영향
Argon은 이미 내부 Google 프로세스에 통합되어 있으며, 수천 명의 직원들이 전문적인 코딩, 연구 깊이, 글쓰기 품질 향상을 보고하고 있습니다. 주목할 만한 활용 사례는 다음과 같습니다:
- 양자 알고리즘 최적화 – 공개된 기준 대비 분산 시간 자원(qubits × 게이트)을 40% 감소시켰으며, 몇 분 내에 완료되었습니다.
- 메모리 효율성 – 펌웨어 전체 텔레메트리 분석을 통해 300 TiB 이상의 메모리를 해제했으며, 총 절감량은 500 TiB – 1 PiB로 예상됩니다.
- 대규모 코드 마이그레이션 – Argon 에이전트는 C/C++ 코드베이스를 Rust로 변환하며, 수만 줄(예:
re2,libgav1)에서 Fuchsia OS Zircon 커널의 800,000 줄 이상으로 확장했습니다.libgav1의 경우, 안전한 Rust로 32 K 줄의 SIMD 코드를 대체하여 이전 Rust 포트보다 2.7배 빠른 성능을 달성하면서도 비디오 출력을 유지했습니다.
컨텍스트 길이 1 M 토큰으로 확장
더 긴, 더 복잡한 작업을 처리하기 위해 Argon의 최대 출력 길이는 64 K에서 1 백만 토큰으로 증가했습니다. 이는 업계 최고 수준이며, 한 번의 통과로 긴 추론 체인을 생성할 수 있게 해, 이전에는 여러 상호작용이 필요했던 작업에서 성능을 향상시킵니다.
기업 수준의 코딩 및 지식 업무 성능
Argon의 다중 모달 추론과 장기 컨텍스트 능력은 여러 벤치마크에서 최상위 성과를 보여줍니다:
- DeepSWE v1.1 – 77.9 % 정확도, 장기적 소프트웨어 공학 작업에서 새로운 최첨단 기준 설정
- Vals Index – 미국 GDP 기여도에 따라 금융, 코딩, 법률, 세금 업무를 가중치 부여한 복합 경제적 영향 벤치마크에서 선도
- Vals Finance Agent v2 – 다단계 금융 연구에서 최고 성능
- Harvey’s Legal Agent Benchmark – 법률 연구 및 초안 작성에서 최고 점수
- AutomationBench (Zapier) – 엔드투엔드 비즈니스 프로세스 자동화에서 51.3 %의 점수로 1위
- LVBench – 91.7 %의 점수로 장기 영상 이해에서 최첨단 성과
이러한 결과는 Argon이 텍스트 중심, 다중 모달, 다단계 기업 워크플로우 전반에서 유연함을 보여줌을 보여줍니다.
방어적 사이버 보안 능력
Argon은 사이버 보안 방어를 위해 특화되었으며, 사이버 전용 가드레일 없이 신뢰할 수 있는 방어자들에게 공개되어 전반적인 능력을 드러냅니다. 주목할 만한 성과는 다음과 같습니다:
- 취약점 탐지 – Google 내부 벤치마크에서 20개의 프로그래밍 언어로 구성된 코드베이스에서 광범위한 노출을 식별했습니다.
- Wiz Scan‑for‑Good 협력 – 글로벌 헬스케어 소프트웨어에서 개인 정보를 노출하는 심각한 취약점을 발견했으며, 이는 이전 전면 모델들이 놓친 위험입니다.
- CWE‑bench v1 – 68 %의 수정 점수로 1위 공동 기록, CWE‑bench v0에서 3.8 Flash Cyber 모델의 성능을 개선했습니다.
- Wiz 내부 침투 테스트 – 공격 표면 매핑, 취약점 식별, 개념 증명 생성에서 3.8 Flash Cyber를 능가했습니다.
전면 가드레일 강화
광범위한 출시 전에 DeepMind는 네 가지 가드레일 카테고리를 강화하고 있습니다:
- 오용 방지 – 사이버, 화학, 생물, 방사능, 핵 공격을 촉진하는 요청은 거부하지만, 합법적인 이중 용도 연구는 허용합니다. 강건성 테스트는 내부 및 외부 레드팀 연습과 내부 활성화 모니터링을 포함합니다(자세한 내용은 arXiv:2601.11516 참조).
- 프롬프트 주입 저항성 – Gray Swan 간접 프롬프트 주입 벤치마크에서 선도적인 강건성을 보이며, 자동화된 레드팀 연습과 적대적 훈련을 통해 달성했습니다.
- 부정렬 모니터링 – 사고 체인과 행동 모니터링은 모델이 사용자 의도에서 벗어날 경우 실행을 중단하고, 경고를 전담 사고 대응 팀에 전달합니다.
- 시스템 강화 – 고위험 훈련 또는 평가 전에 사전에 격리되고 밀봉된 사전 환경을 사용하며, DeepMind의 에이전트 제어 로드맵을 따릅니다.
DeepMind는 모델의 사고를 정렬 작업 중 관찰 가능하게 유지하기 위해 더 넓은 AI 공동체가 추론 투명성 관행을 채택할 것을 촉구합니다.
출시 일정
Gemini 4 Argon은 Fairwind 프로그램의 신뢰할 수 있는 사이버 방어자 코호트에게 먼저 제공됩니다. 이후 단계에서는 개발자, 기업, 소비자에게 접근 권한을 확대하며, 유료 API 고객과 Google AI Ultra 구독자부터 시작됩니다.
함의
- 생산성 향상 – 1 M토큰 컨텍스트와 고도의 추론 능력으로 개발자와 지식 종사자들이 이전에는 광범위한 인간 노력이나 여러 모델 호출이 필요했던 작업을 처리할 수 있습니다.
- 보안 영향 – 취약점 탐지 및 패치 생성을 자동화함으로써 Argon은 소프트웨어 공급망 전반의 수정 주기를 가속화할 수 있습니다.
- 안전성 고려사항 – 단계적 출시와 광범위한 가드레일 개발은 DeepMind가 전면 기능의 책임 있는 배포에 대한 약속을 보여줍니다.
참고 자료
- Fairwind 프로그램 – https://deepmind.google/fairwind-program/
- 전면 안전 프레임워크 – https://deepmind.google/blog/strengthening-our-frontier-safety-framework/
- 에이전트 제어 로드맵 – https://deepmind.google/blog/securing-the-future-of-ai-agents/
- Gray Swan IPI 벤치마크 – https://grayswan.io/benchmark/ipi
- CWE‑bench – https://cwe-bench.com/
- Vals Index – https://www.vals.ai/benchmarks/vals_index
- DeepSWE v1.1 – https://github.com/deepswe/evaluation
이 기사는 2026년 9월 30일에 발표된 공식 DeepMind 블로그 게시물 “Gemini 4 Argon: our next era of frontier intelligence”를 기반으로 합니다.