SandboxAQ SAIR 資料集發布
SandboxAQ 已發布結構增強 IC50 資料庫(SAIR),這是目前最大規模的共摺疊 3D 蛋白質‑配體結構資料集,配有實驗測量的 IC₅₀ 標籤。此發布彌補了製藥研發中關鍵的資料缺口,直接將分子 3D 結構與藥物效力相連,使研究人員能將更多藥物設計與優化工作從濕實驗室轉移至電腦模擬環境。
擴展蛋白質‑配體結構資料
SAIR 提供超過 500 萬個 AI 生成的高精度蛋白質‑配體 3D 結構的開放存取。此資料集透過彙整超過 100 萬個獨特的計算共摺疊蛋白質‑配體對而建立,產生 524 萬個不同的 3D 複合體(每對產生五個共摺疊結構)。每個結構皆配有從 ChEMBL 或 BindingDB 取得的精選 IC₅₀ 測量值。
如此規模的資料解決了傳統結構導向發現的限制,後者依賴耗時的實驗方法,如 X 射線晶體學與冷凍電鏡。與先前的演算法(如 AlphaFold 或 Vina)僅提供靜態快照不同,SAIR 的共摺疊方法在高品質 3D 結構與藥物效力之間提供了更具可擴展性的連結。
高效能運算與生成
- 計算效能: 此資料集使用 Boltz1 共摺疊 AI 模型,在由 760 顆 NVIDIA H100 處理器組成的叢集上,透過 NVIDIA DGX Cloud 於 Google Cloud Platform 產生。
- 資源利用率: 透過 NVIDIA AI Accelerator 與 SandboxAQ 的合作,團隊達成超過 95% 的 GPU 計算利用率。
- 效率: 總計算時間超過 130,000 GPU 小時。優化的工作流程將生成時程從預估的三個月縮短至三週,達到 4 倍的加速。
驗證與資料品質
為確保 AI 生成複合體的物理合理性與化學正確性,SandboxAQ 使用了 PoseBusters——一個業界標準的開源基準測試工具。驗證結果顯示,SAIR 中有 97% 的結構通過了所有 PoseBusters 檢查。
此外,SandboxAQ 針對合成結構與實驗 IC₅₀ 數值,對領先的親和力預測方法(包括圖神經網路、3D CNN 以及經驗性打分函數)進行了基準測試。詳細結果可於 bioRxiv 上的科學手稿中取得。
應對「暗蛋白質組」
SAIR 為缺乏實驗資料的蛋白質提供結構假說,特別針對「暗蛋白質組」(與疾病相關且尚無實驗結構的蛋白質)。
- 擴展目標視野: SAIR 資料集中超過 40% 的蛋白質在蛋白質資料庫 (PDB) 中沒有可用的結構,無論其是否與配體結合。
- 多靶點藥理洞見: 資料集跨目標的廣度使研究人員能辨識單一分子與多個蛋白質的相互作用,促進離靶效應的預測與藥物再利用機會的發掘。
存取與實作
SAIR 以寬鬆的 CC BY 4.0 授權發布,並託管於 Hugging Face。資料集包含一個主表格(sair.parquet)以及多個位於 structures_compressed/ 目錄下的壓縮結構檔案(.tar.gz)。
研究人員可使用 huggingface_hub、pandas 與 pyarrow 套件存取資料。結構檔案體積較大(每個約 10 GB),文件建議僅下載所需的檔案以進行本機解壓。