SandboxAQ SAIR 데이터셋 릴리스
SandboxAQ는 공동 접힘 3D 단백질-리간드 구조와 실험적으로 측정된 IC₅₀ 라벨을 짝지은 가장 큰 데이터셋인 Structurally Augmented IC50 Repository (SAIR)를 공개했습니다. 이 릴리스는 분자 3D 구조를 약물 효능과 직접 연결함으로써 제약 R&D에서 중요한 데이터 격차를 메우며, 연구자들이 더 많은 약물 설계와 최적화를 습식 실험실에서 인실리코 환경으로 이동할 수 있게 합니다.
단백질-리간드 구조 데이터 확장
SAIR는 5백만 개가 넘는 AI 생성 고정밀 단백질-리간드 3D 구조에 대한 오픈 액세스를 제공합니다. 이 데이터셋은 100만 개가 넘는 고유한 계산적으로 공동 접힘된 단백질‑리간드 쌍을 수집하여 만들었으며, 그 결과 524만 개의 서로 다른 3D 복합체(쌍당 5개의 공동 접힘 구조)가 생성되었습니다. 각 구조는 ChEMBL 또는 BindingDB에서 가져온 정제된 IC₅₀ 측정값과 짝을 이룹니다.
이러한 규모의 데이터는 X-선 결정학 및 크라이오-EM과 같은 시간 소모적인 실험 방법에 의존하는 전통적인 구조 기반 탐색의 한계를 해결합니다. AlphaFold나 Vina와 같은 기존 알고리즘이 정적인 스냅샷을 제공하는 것과 달리, SAIR의 공동 접힘 접근법은 고품질 3D 구조와 약물 효능 사이의 보다 확장 가능한 연결을 제공합니다.
고성능 컴퓨팅 및 생성
- Compute Power: 데이터셋은 Google Cloud Platform의 NVIDIA DGX Cloud를 통해 760개의 NVIDIA H100 프로세서 클러스터에서 Boltz1 공동 접힘 AI 모델을 사용하여 생성되었습니다.
- Resource Utilization: NVIDIA AI Accelerator와 SandboxAQ 간의 협업을 통해 팀은 GPU 컴퓨팅 활용률 95% 이상을 달성했습니다.
- Efficiency: 총 컴퓨팅 시간은 130,000 GPU 시간을 초과했습니다. 최적화된 워크플로우는 생성 기간을 예상 3개월에서 3주로 단축했으며, 이는 4배 속도 향상을 의미합니다.
검증 및 데이터 품질
AI가 생성한 복합체의 물리적 타당성과 화학적 건전성을 보장하기 위해 SandboxAQ는 업계 표준 오픈소스 벤치마킹 도구인 PoseBusters를 활용했습니다. 검증 결과 SAIR의 구조 중 97%가 모든 PoseBusters 검사를 통과한 것으로 나타났습니다.
또한 SandboxAQ는 그래프 신경망, 3D CNN, 경험적 스코어링 함수 등 주요 친화성 예측 방법들을 합성 구조와 실험 IC₅₀ 값에 대해 벤치마크했습니다. 자세한 결과는 bioRxiv에 게재된 과학 원고에서 확인할 수 있습니다.
"다크 프로테옴" 문제 해결
SAIR는 실험 데이터가 없는 단백질에 대한 구조적 가설을 제공하며, 특히 기존 실험 구조가 없는 질병 관련 단백질인 "다크 프로테옴"을 대상으로 합니다.
- Expanding Target Horizons: SAIR 데이터셋에 포함된 단백질 중 40% 이상이 리간드 결합 여부와 관계없이 Protein Data Bank (PDB)에 구조가 존재하지 않습니다.
- Polypharmacology Insights: 데이터셋의 다중 타깃 범위는 연구자들이 하나의 분자가 여러 단백질과 어떻게 상호작용하는지를 파악하게 하여, 오프 타깃 효과 예측 및 약물 재활용 기회 식별을 촉진합니다.
접근 및 구현
SAIR는 허용적인 CC BY 4.0 라이선스로 공개되며 Hugging Face에 호스팅됩니다. 데이터셋은 메인 테이블(sair.parquet)과 structures_compressed/ 디렉터리에 위치한 여러 압축 구조 아카이브(.tar.gz)로 구성됩니다.
연구자들은 huggingface_hub, pandas, pyarrow 라이브러리를 사용해 데이터를 접근할 수 있습니다. 구조 아카이브는 크기가 크며(각 약 10 GB), 문서에서는 로컬 추출을 위해 필요한 아카이브만 다운로드할 것을 권장합니다.