Google DeepMindがSynthID Bioを発表
Google DeepMindは、AIによって生成された生物配列および3D構造を識別するためのウォーターマーキングシステム「SynthID Bio」を発表しました。この技術により、合成タンパク質のデジタルモデルだけでなく、物理的に合成された形態においても検証が可能となり、合成生物学における信頼性の確保に重要な一歩を踏み出します。
SynthID Bioの技術的実装
SynthID Bioは、処理対象の生物データの種類に応じて異なるウォーターマーキング手法を採用し、タンパク質の生物学的機能に影響を与えることなく検出可能な信号を生成することを目的としています。
タンパク質配列へのウォーターマーキング
タンパク質配列に対しては、アミノ酸の選択をわずかに誘導する仕組みを採用しています。このプロセスは、タンパク質バインダーの設計に用いられるProteinMPNN(一般的なタンパク質配列生成手法)のSynthID Bio対応版と、AlphaProteoを組み合わせて検証されました。
3D構造へのウォーターマーキング
タンパク質の折りたたみおよび3D構造に対しては、AlphaFold 3の拡散ネットワークの一部を微調整します。ウォーターマーキングをモデルの重みに直接埋め込むことで、予測された3D座標に検出可能なシグネチャが内在します。この方法はAlphaFold 3の予測精度を維持し、デジタルノイズや微小な座標調整に対しても堅牢です。
実験的検証と性能
Vascular Endothelial Growth Factor-A(VEGF-A)、SARS-CoV-2スパイクタンパク質のRBD、PD-L1の3つの標的タンパク質に結合するタンパク質バインダーを設計し、実験室(wet-lab)でのテストを実施しました。その結果、ウォーターマーキングされた設計は、ウォーターマーキングなしのバージョンと以下の3つの指標で一致しました:
- ヒット率:成功したバインダーの頻度。
- 結合親和性:$K_D$で測定され、低い値ほど強いバインダーを示す。
- 自然な配列多様性:生成された配列の多様性。
生物セキュリティと情報の完全性への影響
SynthID Bioは、「スイスチーズ」型防御モデルの一環として設計されており、他の安全対策の穴を埋める実質的な検証層を提供します。
DNA合成スクリーニング
DNA合成プロバイダーは、既知の脅威データベースと照合してリクエストをスクリーニングしています。しかし、生成AIは既知の危険と類似しない完全に新しい配列を生成できるため、手動でのレビューは時間がかかります。SynthID Bioは、信頼できるモデルから生成されたことを自動的に証明する信号を提供し、スクリーニングプロセスを効率化します。
データベースの完全性
この技術は、UniProt、GenBank、Protein Data Bankなどの公開生物データベースへのAI生成エントリの汚染を防ぐことを目的としています。AI生成データが適切にラベル付けまたはフラグ付けされることで、誤ってラベル付けされた合成構造が後続の研究を誤導するリスクを低減します。
今後の方向性と研究
Google DeepMindは、SynthID Bioの応用をより複雑な生物的対象へと拡大しています。スタンフォード大学のHieラボおよびArc Instituteと協力し、ゲノムモデルEvo 2にSynthID Bioを統合し、設計された細菌性ウイルス(バクテリオファージ)のゲノムにウォーターマーキングを施しました。初期の実験室テストにより、これらのウォーターマーキングされたバクテリオファージが機能を維持していることが確認されています。
研究をさらに進めるために、Google DeepMindはコードのオープンソース化、重みの公開、方法論論文およびin vitroデータの公開を通じて、研究コミュニティに貢献しています。
Sources
- OriginalIntroducing SynthID Bio