Gemini 2.5 Deep Think ICPC 世界总决赛表现
Gemini 2.5 Deep Think ICPC 世界总决赛表现
An advanced version of Gemini 2.5 Deep Think achieved gold-medal level performance at the 2025 International Collegiate Programming Contest (ICPC) World Finals, solving 10 out of 12 complex algorithmic problems.
Gemini 2.5 Deep Think ICPC 世界总决赛表现
Gemini 2.5 Deep Think 在 ICPC 世界总决赛中达到金牌水平
Gemini 2.5 Deep Think 的高级版本在2025年国际大学生程序设计竞赛(ICPC)世界总决赛中达到了金牌水平的表现。此里程碑展示了在抽象问题求解方面的显著飞跃,并且紧随两个月前在国际数学奥林匹克(IMO)获得金牌标准的成就。
性能指标与排名
Gemini 2.5 Deep Think 在比赛期间解决了12道题中的10道,遵循与人类选手相同的五小时时间限制(在开始后10分钟启动)。
关键性能统计包括:
- Problem Solving Rate: 正确解决了10/12道题。
- Speed: 前45分钟内解决了8道题,另外两道在三小时内解决。
- Total Time: 模型总共用了677分钟来解决这10道题。
- Comparative Rank: 根据这些结果,Gemini 2.5 Deep Think 在比赛中大学队伍整体排名将位列第二。
解决未解题目:问题 C 案例
Gemini 2.5 Deep Think 成功解决了问题 C,这是一项在比赛中没有任何大学队伍能够解决的任务。问题 C 涉及通过相互连接的管道网络向水库分配液体,以找到最快的填充配置。
为了解决该问题,模型采用了一条复杂的推理链:
- Priority Value Assumption: 假设每个水库都有一个表示其相对优先程度的“priority value”。
- Dynamic Programming: 使用动态规划算法在给定的 priority values 集合下寻找最佳管道配置。
- Minimax Theorem: 应用了极小极大定理,以找到使得流动最受约束的 priority values。
- Nested Ternary Searches: 利用嵌套的三分搜索在类似碗形的凸解空间中导航,确定最优的 priority values。
突破的技术基础
模型的表现是预训练、后训练、新颖强化学习(RL)技术、多步推理和并行思考等综合进展的结果。
为了提升其能力,Google DeepMind 对 Gemini 进行训练,使其能够推理并为最困难的编程问题生成代码,从而让模型通过结果反馈学习并演进其方法。系统使用多个 Gemini 代理,提出解决方案,通过终端执行代码和测试,并根据所有尝试的结果迭代这些方案。
内部研究表明,这一版本的 Gemini 2.5 Deep Think 也将在2023年和2024年 ICPC 世界总决赛中达到金牌水平的表现,表现相当于全球前20名的竞技程序员。
对软件工程和 AGI 的影响
此成就表明,AI 可以作为程序员的高级问题求解伙伴。Google DeepMind 指出,如果将比赛中最佳的 AI 与人类解决方案相结合,所有12道题都将被正确解决,这暗示了 AI 与人类专长之间的互补关系。
超越编码,理解复杂问题、制定多步逻辑计划并完美实现的能力可应用于其他科学与工程领域,如芯片设计和药物发现。此进展标志着向通用人工智能(AGI)迈出一步,使 AI 从信息处理转向解决复杂推理问题。
Gemini 成功加入这一领域并取得金牌级别的成果,标志着在定义下一代所需的 AI 工具和学术标准方面的关键时刻。
— Bill Poucher 博士,ICPC 全球执行董事