Google DeepMind 推出 SynthID Bio

Google DeepMind 推出了 SynthID Bio,這是一種水印系統,旨在識別由人工智慧生成的生物序列和 3D 結構。此技術可讓合成蛋白質在數位模型中,以及其物理合成形式中都能被驗證,為合成生物學提供關鍵的來源追溯層級。

SynthID Bio 的技術實現

SynthID Bio 會根據所處理的生物資料類型,採用不同的水印方法,以確保產生可檢測的訊號,同時不改變蛋白質的生物功能。

蛋白質序列水印

針對蛋白質序列,系統會微妙地引導氨基酸的選擇。此過程已透過啟用 SynthID Bio 的 ProteinMPNN(一種常見的蛋白質序列生成方法)與 AlphaProteo 結合,用於設計蛋白質結合劑,進行驗證。

3D 結構水印

針對蛋白質摺疊與 3D 結構,SynthID Bio 會微調 AlphaFold 3 的部分擴散網路。透過直接將水印嵌入模型權重,預測的 3D 坐標本身便內建可檢測的簽名。此方法維持 AlphaFold 3 的預測準確性,並對數位雜訊或微小座標調整具有韌性。

實驗驗證與效能

在實驗室中對設計能鎖定三種目標蛋白的蛋白質結合劑進行測試:VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1。結果顯示,帶水印的設計在三個關鍵指標上與未帶水印版本相符:

  • 命中率:成功結合劑的頻率。
  • 結合親和力:以 $K_D$ 衡量,數值越低表示結合力越強。
  • 自然序列多樣性:產生的序列多樣性。

生物安全與資訊完整性影響

SynthID Bio 設計為「瑞士起司」防禦模型的一部分,為生物設計增加具體的驗證層級,以彌補其他安全措施的缺口。

DNA 合成篩選

DNA 合成供應商會將請求與已知威脅資料庫進行比對。然而,由於生成式人工智慧可創造完全新的序列,這些序列與已知危害無相似之處,因此人工審查可能耗時。SynthID Bio 提供自動化驗證訊號,可證明序列源自具備內建防護機制的可信模型,從而簡化篩選流程。

資料庫完整性

該技術旨在防止公共生物資料庫(如 UniProt、GenBank 和 Protein Data Bank)受到污染,確保人工智慧生成的條目能正確標記或警示,降低錯誤標記的合成結構誤導後續研究的風險。

未來方向與研究

Google DeepMind 正擴展 SynthID Bio 在更複雜生物物件上的應用。與史丹福大學 Hie 實驗室及 Arc Institute 合作,團隊將 SynthID Bio 整合至 Evo 2(一種基因組模型),用以對設計的細菌噬菌體基因組進行水印。早期實驗室測試已確認這些帶水印的噬菌體仍具功能。

為進一步推動研究,Google DeepMind 將開源程式碼,釋出權重,並發表方法論論文與 in vitro 資料,供研究社群使用。

Sources