科学计算在具代理能力的 AI 时代 – OpenAI 现场报告
科学计算在具代理能力的 AI 时代 – OpenAI 现场报告
OpenAI 的现场报告表明,AI 代理显著加速了科学软件的开发和维护,使研究人员能够更多地关注科学方向,而较少关注实现细节,但长期的 stewardship(管理)和人工验证仍然是构建持久工具的关键。
现场报告概览
该报告呈现了一项对八个 AI 辅助科学计算项目的探索性研究,主要集中在生命科学领域,其中五个项目仅使用了 Codex,另外三个项目结合使用了 Codex 和 Claude Code。
AI 代理展示的关键能力
AI 代理降低了工程工作的成本,承担了乏味的实现任务,帮助研究人员快速原型化想法,开展以前不切实际的项目,并在长期内维护软件,从而产生更高效且维护更好的科学软件。
案例研究亮点
一个案例研究现代化了广泛使用的 cyvcf2 库,用于解析基因组数据;GPT‑5.5 替换了该库的遗留构建和打包系统,采用了一个现代化、统一的流程,旨在使该库更易于安装、测试和发布。
使用编码代理,快速前进变得很容易;目前,要在科学领域走得更远,仍然需要专家的指导、理解、品味和细心。 —Brent Pedersen
AI 辅助开发中的反复出现的主题
在这些项目中,代理使得工程劳动不再是瓶颈,但瓶颈转移到了验证 AI 代理的输出上,这仍然依赖于人工判断。 代理能够有效处理具体且范围明确的请求,但无法可靠地判断科学有效性或满足期望,即使其工作中存在明显错误,也常常表现出过度的自信。 因此,人工审阅者需要可靠的验证方法,例如外部参考或可衡量的接受目标(精确输出一致、与现有工具保持一致、适当的统计行为,或使用模拟数据预先设定的答案)。 项目通过反馈驱动的迭代分阶段进行:将宏大目标拆分为更小的更改,中间基准和测试系统评估并改进代理的工作,虽然代理能够快速生成初始实现,但解决边界情况和细微的数值差异需要更长时间,而“最后一英里”往往需要最多的努力。
验证和 stewardship 的挑战
贡献者一致描述了研究人员角色的转变:从实现转向验证和编排——明确要构建什么,定义如何衡量正确性,并决定何时项目准备好发布,同时仍然掌控科学方向和质量标准。 报告指出,建立明确的长期责任和对所得工具的 stewardship 持续存在挑战。
对持久科学软件的影响
长期 stewardship 是必不可少的,因为研究软件中的维护差距会减慢迭代,限制可重复性和可靠性,且发表的研究表明,研究代码常常无法按照文档安装或运行,迫使研究人员花费大量时间在配置和调试上。 较低的实现成本使得生成许多类似的重写变得更容易,这可能导致用户分散,并分散维持任何一个工具可靠所需的专家注意力;因此,成熟的科学软件需要明确的所有者和可信的维护计划。 案例研究展示了可能的前进路径:对 MHCflurry 和 cyvcf2 的更改被并入了它们的原始上游项目,而 rustar‑aligner 则转移到了新的社区 stewardship 下,因为原始项目已经被废弃。 当可以与现有维护者协调时,应尽早开始;当需要单独实现时,需要一个明确的所有者和一个可信的维护计划。 没有这样的 stewardship,今天的现代重写可能会变成明天被废弃的代码,而不是可靠的科学基础设施。
迈向更持久的科学软件
该现场报告是回顾性和探索性的,但案例研究指出了一种实际的转变:科学软件的开发方式正在变化——诸如 Codex 之类的编码代理可以显著降低维护、迁移、优化和新实现的成本。 它们的长期科学价值仍然取决于人类在决定构建什么、如何验证以及谁将维护它方面的决策。 更深层次的变化不仅仅是研究人员可以生成更多软件,而是他们能够将更多精力用于定义、验证和 stewardship 工具。 这些案例研究表明,代理已经能够加速科学计算中的迭代速度,并且随着编码代理的改进,研究人员将能够花费更少的时间来保持分析管道运行,而将更多时间用于推进他们的领域。