OpenAI GPT-5 生物研究能力

GPT-5 将分子克隆效率提高 79 倍

OpenAI 与生物安全初创公司 Red Queen Bio 合作,证明了 GPT-5 能够自主推理、提出并迭代湿实验方案,从而显著加速生物研究。在受控的实验设置中,GPT-5 优化了一种分子克隆方案,相比基线 HiFi 组装方案,效率提高了 79 倍。

这一改进是通过两种不同优化的组合实现的:

  • 酶促组装 (RAPF): 提高 2.6 倍。
  • 转化方案 (T7): 提高 36 倍。

这些加法改进的组合导致在固定量的输入 DNA 下,序列验证克隆的回收量总共提高了 79 倍。

RAPF-HiFi 酶促机制的发现

GPT-5 提出了一种新型酶促程序,称为“RecA 辅助配对-完成 HiFi 组装”(RAPF-HiFi)。该模型识别出两种蛋白质的协同组合,以改善 DNA 组装的同源搜索和退火过程:

  1. **gp32(噬菌体 T4 基因 32 单链 DNA 结合蛋白):通过去除二级结构来平滑和解开松散的 DNA 末端。
  2. **RecA(来自大肠杆菌的重组酶):引导每条 DNA 链到其正确匹配,促进同源搜索和退火。

作用机制的技术细节

OpenAI 假设 RAPF-HiFi 机制的运作方式如下:

  • T5 外切酶 产生 3’ 过伸。
  • gp32 包覆未退火的单链 DNA(ssDNA)尾部以抑制二级结构。
  • RecA 从 3’ 端进入,置换 gp32 并推动匹配序列的退火。
  • 热重置: 返回 50°C 会置换 RecA 和 gp32,使标准聚合酶和连接酶能够完成反应。

模型的推理过程通过其选择 gp32 而非更常见的 E. coli SSB 蛋白得到凸显;虽然 SSB 是 RecA 的天然伙伴,但它结合得过于稳定,无法满足此方案所需的高效 RecA 置换。

转化方案 (T7) 的优化

虽然酶促组装经过了五轮迭代优化,但转化过程是在一次“单次”轮次中优化的。GPT-5 确定了一种称为“转化 7”(T7)的修改,该修改包括沉淀细胞、移除所提供体积的一半,并在 4°C 下重悬细胞,然后再加入 DNA。

尽管实验室普遍认为高效化学感受态细胞脆弱且不应如此处理,但细胞耐受了此浓缩过程。该修改增加了分子碰撞并减少了抑制性缓冲液,导致转化效率提高了超过 30 倍。

用于湿实验迭代的 AI 驱动进化框架

为了测试模型的能力,OpenAI 使用了一个进化框架,其中 GPT-5 从实验反馈中“在线”学习:

  • 迭代循环: GPT-5 每轮提出 8-10 反应的批次。
  • 人机交互执行: 人类科学家执行了这些方案,并提供了相对于基线的菌落计数。
  • 标准化提示: 为了确保 AI 的贡献独立于人类指导,提示被固定,除了澄清问题之外没有人工干预。

OpenAI 指出,当前系统的固定提示限制了探索与利用之间的平衡,表明未来在规划和任务视野推理方面的进步可能带来更大的收益。

自主机器人执行

OpenAI 与 Robot on Rails 合作,开发了一套机器人系统来执行这些自然语言协议。该系统集成了人类到机器人的 LLM、用于实验器具定位的实时视觉系统以及机器人路径规划器。

在比较测试中,机器人成功执行了改进的 R8 方案,相比基线提高了 2.13 倍,这相当于人类研究人员表现的 89%(2.39 倍)。由于液体处理和温度校准差异,机器人的绝对菌落计数大约比手动执行低十倍,但机器人准确排序方案的能力展示了完全自主的生物实验优化的潜力。

生物安全与安全框架

鉴于生物推理能力可能带来的风险,此研究在使用无害实验系统的严格受控环境中进行。OpenAI 正在利用这些结果来为生物安全风险评估提供信息,并作为其准备框架的一部分开发防护措施。

Sources