OpenAI 与 Retro Biosciences:使用 GPT-4b micro 加速生命科学
OpenAI 与 Retro Biosciences 开发了 GPT-4b micro,这是 GPT-4o 的一种专用微型版本,专为蛋白质工程设计。与 Retro Biosciences 合作时,该模型用于重新设计参与干细胞重编程的蛋白质,产生的重新设计蛋白质实现了比野生型对照高出超过 50 倍的干细胞重编程标记表达,并展示了增强的 DNA 损伤修复能力。
GPT-4b micro:用于蛋白质工程的专用模型
GPT-4b micro 是一个自定义模型,基于 GPT-4o 的缩小版初始化,并在包含蛋白质序列、生物学文本以及标记化 3D 结构数据的数据集上进一步训练。该架构使模型能够处理结构化蛋白质以及具有本质无序区的蛋白质,例如 Yamanaka 因子。
技术训练与数据增强
为了提升可控性和灵活性,训练数据被增强为:
- Contextual Information:蛋白质的文字描述。
- Co-evolutionary Homologous Sequences:相关蛋白质序列的数据。
- Interaction Groups:已知相互作用蛋白质的信息。
这种增强提升了训练示例的有效上下文长度。在推理时,模型支持高达 64,000 个 token 的提示,这一上下文规模被描述为蛋白质序列模型前所未有的。
缩放定律与验证
OpenAI 观察到类似于语言模型的缩放定律,即更大的模型和数据集在困惑度和下游基准上带来可预测的提升。然而,由于体外(in silico)评估往往不足以满足实际应用,模型的能力通过与 Retro Biosciences 合作的湿实验室实验得到了验证。
AI 辅助的 Yamanaka 因子重新设计
Yamanaka 因子(OCT4、SOX2、KLF4 和 MYC,或 OSKM)是将成年细胞重编程为多能干细胞的关键。然而,标准的 OSKM 重编程通常效率低下,转化率不足 0.1%,且过程需要三周或更长时间。
克服设计空间挑战
传统的“定向进化”筛选受限于可能变体的数量,例如 SOX2(317 个氨基酸)和 KLF4(513 个氨基酸)的可能变体约为 10^1000。此前的学术工作涉及数千个突变体或 15 年的嵌合蛋白研究,仅取得了有限的进展。
RetroSOX 与 RetroKLF 筛选结果
使用人类成纤维细胞的湿实验筛选平台,Retro Biosciences 利用 GPT-4b micro 提出了 “RetroSOX” 序列。结果显示:
- High Hit Rate:模型建议中超过 30% 的序列在关键多能性标记的表达上优于野生型 SOX2,而传统筛选的命中率通常低于 10%。
- Deep Sequence Edits:成功的变体平均比野生型多出超过 100 个氨基酸。
- Accelerated Reprogramming:将顶级 RetroSOX 与 RetroKLF 变体组合,可显著提升早期(SSEA-4)和晚期(TRA-1-60、NANOG)标记的表达,晚期标记出现的时间比野生型 OSKM 组合提前数天。
跨细胞类型和递送方式的验证
为了评估临床潜力,团队使用 mRNA 递送(而非病毒载体)以及来自三位中年(>50 岁)人类供体的间充质基质细胞(MSCs)进行测试。结果包括:
- Rapid Expression:在 7 天内,超过 30% 的细胞表达了多能性标记(SSEA4 和 TRA-1-60)。
- High Activation:到第 12 天,超过 85% 的细胞激活了内源性 OCT4、NANOG、SOX2 和 TRA-1-60 的表达。
- Stability:产生的 iPSC 能分化为三大胚层,并保持健康的染色体核型和基因组稳定性。
增强的 DNA 损伤修复与复兴
除了重编程效率,研究人员还通过评估这些工程变体恢复老化细胞青春特征的能力,特别是 DNA 损伤(衰老标志)的修复,来探讨其复兴潜力。
在使用 $\gamma$-H2AX 免疫染色定量双链断裂的 DNA 损伤检测中,接受 RetroSOX/KLF 组合处理的细胞的 $\gamma$-H2AX 强度显著低于使用标准 OSKM 或荧光对照重编程的细胞。这表明工程变体比原始 Yamanaka 因子更有效地降低 DNA 损伤,暗示了改进细胞复兴疗法的潜在途径。