SandboxAQ SAIR 数据集发布
SandboxAQ 已发布结构增强 IC50 仓库(SAIR),这是目前规模最大的共折叠 3D 蛋白-配体结构数据集,配有实验测定的 IC₅₀ 标签。此发布弥合了制药研发中的关键数据缺口,直接将分子 3D 结构与药物效力关联,使研究人员能够将更多药物设计和优化工作从湿实验室转移到计算环境中。
扩展蛋白-配体结构数据
SAIR 提供开放访问,包含超过 500 万 AI 生成的高精度蛋白-配体 3D 结构。该数据集通过汇总超过 100 万个独特的计算共折叠蛋白-配体对构建,产生了 524 万个不同的 3D 复合体(每对产生五个共折叠结构)。每个结构都配有来自 ChEMBL 或 BindingDB 的精心整理的 IC₅₀ 测量值。
如此规模的数据解决了传统基于结构的发现的局限性,后者依赖于耗时的实验方法,如 X 射线晶体学和冷冻电镜。不同于 AlphaFold 或 Vina 等早期算法仅提供静态快照,SAIR 的共折叠方法在高质量 3D 结构与药物效力之间提供了更具可扩展性的关联。
高性能计算与生成
生成 SAIR 数据集需要大量计算资源和基础设施优化:
- 计算能力: 数据集使用 Boltz1 共折叠 AI 模型在由 760 个 NVIDIA H100 处理器组成的集群上生成,借助 NVIDIA DGX Cloud 在 Google Cloud Platform 上运行。
- 资源利用率: 通过 NVIDIA AI Accelerator 与 SandboxAQ 的合作,团队实现了超过 95% 的 GPU 计算利用率。
- 效率: 总计算时间超过 130,000 GPU 小时。优化后的工作流将生成时间从预计的三个月缩短至三周,实现了 4 倍加速。
验证与数据质量
为确保 AI 生成复合体的物理合理性和化学可靠性,SandboxAQ 使用了 PoseBusters——业界标准的开源基准测试工具。验证结果显示,SAIR 中有 97% 的结构通过了所有 PoseBusters 检查。
此外,SandboxAQ 对领先的亲和力预测方法——包括图神经网络、3D CNN 和经验评分函数——在合成结构和实验 IC₅₀ 值上进行了基准测试。详细结果可在 bioRxiv 上发布的科学手稿中查阅。
应对“暗蛋白组”
SAIR 为缺乏实验数据的蛋白质提供结构假设,特别针对“暗蛋白组”(与疾病相关但尚无实验结构的蛋白质)。
- 拓展靶标视野: SAIR 数据集中超过 40% 的蛋白质在 Protein Data Bank (PDB) 中没有可用结构,无论其是否与配体结合。
- 多靶点药理学洞察: 数据集的跨靶标广度使研究人员能够识别单一分子与多个蛋白的相互作用,帮助预测离靶效应并发现药物再利用的机会。
访问与实现
SAIR 在宽松的 CC BY 4.0 许可证下发布,并托管于 Hugging Face。数据集包括一个主表(sair.parquet)和多个压缩结构归档(.tar.gz),位于 structures_compressed/ 目录中。
研究人员可以使用 huggingface_hub、pandas 和 pyarrow 库访问数据。结构归档体积较大(约每个 10 GB),文档建议仅下载所需的归档进行本地解压。