Google DeepMind 推出 SynthID Bio

Google DeepMind 推出了 SynthID Bio,这是一种水印系统,旨在识别由人工智能生成的生物序列和 3D 结构。该技术不仅能够在数字模型中验证合成蛋白质,还能在实际合成的物理形式中进行验证,为合成生物学提供了关键的来源追溯层。

SynthID Bio 的技术实现

SynthID Bio 根据所处理的生物数据类型采用不同的水印方法,以确保生成可检测的信号,同时不改变蛋白质的生物学功能。

蛋白质序列水印

对于蛋白质序列,该系统微妙地引导氨基酸的选择。该过程通过使用启用了 SynthID Bio 的 ProteinMPNN(一种常见的蛋白质序列生成方法)与 AlphaProteo 结合设计蛋白质结合剂进行了验证。

3D 结构水印

对于蛋白质折叠和 3D 结构,SynthID Bio 对 AlphaFold 3 的扩散网络的一小部分进行微调。通过将水印直接嵌入模型权重,预测的 3D 坐标天然携带可检测的签名。该方法保持了 AlphaFold 3 的预测准确性,并对数字噪声或微小坐标调整具有鲁棒性。

实验验证与性能表现

在湿实验中,对三种目标蛋白(VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1)的结合剂设计进行了测试。结果表明,带有水印的设计在三个关键指标上与无水印版本一致:

  • 命中率:成功结合剂的频率。
  • 结合亲和力:以 $K_D$ 衡量,数值越低表示结合能力越强。
  • 天然序列多样性:生成序列的多样性。

生物安全与信息完整性影响

SynthID Bio 被设计为“瑞士奶酪”防御模型的一部分,为生物设计增加一个可验证的层面,以弥补其他安全措施的不足。

DNA 合成筛查

DNA 合成提供商通过已知威胁数据库筛查请求。然而,由于生成式 AI 可以创建完全新颖且不类似于已知危害的序列,人工审查可能耗时较长。SynthID Bio 提供了一种自动验证信号,可证明序列源自具备内置防护机制的可信模型,从而简化筛查流程。

数据库完整性

该技术旨在防止公共生物数据库(如 UniProt、GenBank 和蛋白质数据银行)被污染,通过确保 AI 生成的条目被正确标记或标注,降低因错误标记的合成结构误导下游研究的风险。

未来方向与研究

Google DeepMind 正在将 SynthID Bio 的应用扩展到更复杂的生物对象。在与斯坦福大学 Hie 实验室及 Arc 研究所的合作中,团队将 SynthID Bio 集成到 Evo 2(一种基因组模型)中,对设计的噬菌体基因组进行水印处理。早期实验室测试已证实,这些带水印的噬菌体仍保持功能。

为进一步推进研究,Google DeepMind 正在开源代码,发布模型权重,并发表方法论文和 in vitro 数据,供研究社区使用。

Sources