Gemini 2.5 Deep Think ICPC 월드 파이널 성능
Gemini 2.5 Deep Think가 ICPC 월드 파이널에서 금메달 수준을 달성
Gemini 2.5 Deep Think의 고급 버전이 2025년 국제 대학생 프로그래밍 대회 (ICPC) 월드 파이널에서 금메달 수준의 성능을 달성했습니다. 이 이정표는 추상적인 문제 해결 능력의 큰 도약을 보여주며, 두 달 전 국제 수학 올림피아드 (IMO)에서 금메달 기준을 달성한 것에 이어진 성과입니다.
성능 지표 및 순위
Gemini 2.5 Deep Think는 대회 동안 12문제 중 10문제를 해결했으며, 인간 참가자와 동일한 5시간 제한(시작 후 10분부터 시작) 하에서 작동했습니다.
주요 성능 통계는 다음과 같습니다:
- 문제 해결 비율: 10/12 문제를 정확히 해결했습니다.
- 속도: 8개의 문제를 첫 45분 내에 해결했으며, 추가로 2개의 문제를 3시간 이내에 해결했습니다.
- 총 시간: 모델은 10문제를 해결하는 데 총 677분을 사용했습니다.
- 비교 순위: 이 결과에 따르면 Gemini 2.5 Deep Think는 대회 대학 팀 전체 중 전체 2위에 해당했을 것입니다.
미해결 문제 해결: 문제 C 사례
Gemini 2.5 Deep Think는 대회에서 어느 대학 팀도 해결하지 못한 문제 C를 성공적으로 해결했습니다. 문제 C는 상호 연결된 관망을 통해 액체를 저장소로 분배하여 가장 빠른 충전 구성을 찾는 최적화 작업이었습니다.
이를 해결하기 위해 모델은 정교한 추론 체인을 사용했습니다:
- 우선순위 값 가정: 각 저장소가 상대적인 선호도를 나타내는 "우선순위 값"을 가지고 있다고 가정했습니다.
- 동적 프로그래밍: 주어진 우선순위 값 집합에 대해 최적의 관 구성을 찾기 위해 동적 프로그래밍 알고리즘을 사용했습니다.
- 미니맥스 정리: 결과 흐름을 가장 제한적으로 만드는 우선순위 값을 찾기 위해 미니맥스 정리를 적용했습니다.
- 중첩 삼분 탐색: 그릇 모양의 볼록 해 공간을 탐색하고 최적의 우선순위 값을 식별하기 위해 중첩 삼분 탐색을 활용했습니다.
돌파구의 기술적 기반
모델의 성능은 사전 학습, 사후 학습, 새로운 강화 학습(RL) 기법, 다단계 추론 및 병렬 사고의 통합된 진보의 결과입니다.
능력을 강화하기 위해 Google DeepMind는 Gemini가 가장 어려운 프로그래밍 문제에 대해 추론하고 코드를 생성하도록 훈련했으며, 이를 통해 모델은 결과에 대한 피드백을 학습하고 접근 방식을 진화시킬 수 있게 했습니다. 시스템은 여러 Gemini 에이전트를 활용하여 솔루션을 제안하고, 터미널을 통해 코드와 테스트를 실행하며, 모든 시도의 결과를 기반으로 해당 솔루션을 반복합니다.
내부 연구에 따르면 이 버전의 Gemini 2.5 Deep Think는 2023년 및 2024년 ICPC 월드 파이널에서도 금메달 수준의 성능을 달성할 것이며, 세계 상위 20명의 경쟁 코더와 동등한 수준으로 수행될 것입니다.
소프트웨어 엔지니어링 및 AGI에 대한 시사점
이 성과는 AI가 프로그래머에게 고수준 문제 해결 파트너가 될 수 있음을 나타냅니다. Google DeepMind는 대회에서 최고의 AI와 인간 솔루션을 결합하면 12문제 모두를 정확히 해결할 수 있었을 것이라고 언급하며, AI와 인간 전문성 간의 보완적 관계를 시사합니다.
코딩을 넘어 복잡한 문제를 이해하고, 다단계 논리적 계획을 수립하며, 이를 완벽히 구현하는 능력은 마이크로칩 설계와 신약 개발과 같은 다른 과학 및 공학 분야에도 적용됩니다. 이 진전은 AI를 정보 처리에서 복잡한 추론 문제 해결로 옮겨 인공 일반 지능(AGI)으로 나아가는 단계가 됩니다.
Gemini가 성공적으로 이 분야에 합류하고 금급 결과를 달성한 것은 차세대에 필요한 AI 도구와 학술 표준을 정의하는 데 중요한 순간을 의미합니다.
— Dr. Bill Poucher, ICPC 글로벌 실행 이사