Gemini 2.5 Deep Think 릴리스

Google DeepMind는 Google AI Ultra 구독자를 위해 Gemini 앱에 Deep Think를 통합했으며, 복잡한 문제 해결을 위한 고급 추론을 가능하게 합니다. 이번 릴리스에서는 병렬 사고와 연장된 추론 시간을 활용하여 수학, 코딩, 과학 연구와 같은 고도의 기술 분야에서 성능을 향상시키는 모델 버전을 소개합니다.

병렬 사고와 연장된 추론

Deep Think는 모델이 답을 최종 확정하기 전에 여러 아이디어를 동시에 생성, 평가 및 결합할 수 있도록 하는 병렬 사고 기법을 사용해 Gemini의 추론 능력을 강화합니다. 이 과정은 두 가지 주요 기술 요소에 의해 지원됩니다:

  • 확장된 "Thinking Time": 추론 시간을 늘림으로써 모델이 더 많은 가설을 탐색하고 복잡한 문제에 대한 해결책을 정교화할 수 있습니다.
  • 강화 학습: Google DeepMind는 모델이 이러한 연장된 추론 경로를 활용하도록 장려하는 새로운 강화 학습 기법을 개발했으며, 시간이 지남에 따라 직관적인 문제 해결 능력을 향상시킵니다.

성능 및 사용 사례

Deep Think는 반복적인 개발, 전략적 계획, 단계별 정교화가 필요한 작업을 위해 설계되었습니다. 주요 강점 분야는 다음과 같습니다:

코딩 및 알고리즘 개발

Deep Think는 문제 정의, 시간 복잡도, 트레이드오프 고려가 중요한 어려운 코딩 문제에서 뛰어난 성능을 발휘합니다. 경쟁 코딩 성능을 측정하는 LiveCodeBench V6에서 최첨단 성능을 달성했습니다.

과학 및 수학적 발견

이 모델은 복잡한 과학 논문을 추론하고 수학적 추측을 형성할 수 있습니다. Gemini 2.5 Deep Think 전체 버전은 국제 수학 올림피아드(IMO)에서 금메달 수준을 달성했으며, Gemini 앱에서 제공되는 버전은 일상 사용에 최적화되어 내부 평가 기준으로 2025년 IMO 벤치마크에서 동메달 수준의 성능을 보입니다.

반복 설계

Deep Think는 복잡한 컴포넌트를 하나씩 구축함으로써 웹 개발 작업의 미학과 기능성을 모두 향상시킵니다.

이러한 분야 외에도 모델은 과학 및 수학 전반에 걸친 전문성을 측정하는 "Humanity’s Last Exam" 벤치마크에서 최첨단 성능을 기록했습니다.

안전 및 책임

Gemini 2.5 Deep Think는 Gemini 2.5 Pro에 비해 콘텐츠 안전성과 톤 객관성이 개선되었습니다. 그러나 내부 테스트에서는 무해한 요청을 거부하는 경향이 더 높게 나타났습니다. Google DeepMind는 최전선 안전 평가를 진행하고 있으며, 모델 복잡성 증가와 관련된 위험을 완화하기 위해 중요한 역량 수준에 대한 완화 조치를 구현하고 있습니다.

가용성 및 구현

Deep Think는 Gemini 앱 내에서 Google AI Ultra 구독자에게 제공됩니다. 사용자는 모델 드롭다운에서 "2.5 Pro"를 선택하고 프롬프트 바에서 "Deep Think" 옵션을 토글하여 활성화할 수 있습니다.

주요 운영 세부 사항은 다음과 같습니다:

  • 도구 통합: Deep Think는 Google Search 및 코드 실행과 자동으로 연동됩니다.
  • 응답 길이: 모델은 표준 버전보다 훨씬 긴 응답을 생성할 수 있습니다.
  • API 접근: 도구가 포함된 버전과 포함되지 않은 버전의 Deep Think가 향후 몇 주 안에 Gemini API를 통해 신뢰할 수 있는 테스터에게 출시되어 개발자와 기업이 평가할 수 있도록 제공될 예정입니다.

Sources