Genebench-Pro 내부: 유전체 AI 벤치마킹의 사례 연구
Genebench-Pro 내부: 유전체 AI 벤치마킹의 사례 연구
OpenAI는 엄격한 벤치마크인 Genebench-Pro를 출시하여 AI 모델이 복잡한 유전체 분석을 수행할 수 있는 능력을 평가하도록 설계되었습니다. 이 벤치마크는 모델이 장기 읽기 시퀀싱, 발현 프로파일, 약물유전체 증거 등을 포함한 다중 모달 유전체 데이터를 종합하여 임상적으로 또는 과학적으로 타당한 결론에 도달할 수 있는지 테스트합니다.
Genebench-Pro 사례 연구 개요
Genebench-Pro는 단순한 패턴 인식을 넘어서는 다단계 추론을 수행하고, 기술적 노이즈(예: 주변 RNA 또는 매핑 아티팩트)를 처리하며, 멘델리안 랜덤화나 창시자 재구성과 같은 도메인별 통계적 방법을 적용해야 하는 높은 복잡도의 사례 연구 시리즈를 활용합니다. 성공하려면 모델은 이러한 작업을 수행해야 합니다.
주요 기술 도메인과 작업 요구사항
임상 및 체세포 종양학
Genebench-Pro는 구조적 변이를 기반으로 치료 결정을 내릴 수 있는 능력을 평가합니다. 한 사례 연구에서 모델은 장기 읽기 시퀀싱, 발현 데이터, 종양 품질 증거의 조합에서 목표 하위 집단을 회복하여 합성 TXR1-지향 억제제의 임상적 유용성을 결정한 후 이득과 독성을 해석해야 합니다.
기능 및 규제 유전체학
- CRISPR 대상 검증: 모델은 lncRNA 의존성이 전사 특이적인지 근처 로커스 효과에 의한 것인지 결정해야 하며, 이를 위해 GC 독성, 플레이트 효과, 이웃 유전자 억제를 통제해야 합니다.
- 크로마틴 루프 강도: 모델은 예상 접촉 모델의 왜곡을 방지하기 위해 저매핑 가능성 접촉과 구조적 변이 아티팩트를 마스킹하면서 Hi-C 루프 강도 차이를 정량화하는 작업이 부여됩니다.
통계 및 집단 유전학
- 약물 표적 우선순위 지정: 모델은 연결된 유전자 locus 내 단백질의 직접적인 질병 효과를 추정하기 위해 cis 다변량 멘델리안 랜덤화(cis-MVMR)를 사용해야 하며, 연관 불균형(LD)과 잔여 국소 다형성을 고려해야 합니다.
- 조상 및 혼합: 작업에는 단계별 지역 조상 tracts에서 부모별 조상과 혼합 시기를 추론하는 것이 포함되며, 이는 상호 아티팩트를 복구하고 염색체별 라벨 반전을 수정해야 합니다.
- 고대 DNA 분석: 모델은 시퀀싱 오류 값을 모델링하고 loci를 일관된 유도 알레일 규모에 배치함으로써 노이즈가 있는 고대 알레일 빈도 시계열에서 양성 선택을 추론해야 합니다.
단일 세포 및 구조 유전학
- eQTL 추정: 모델은 활성화된 단핵구 발현에 대한 유전자형의 영향을 추정해야 하며, 이는 eQTL 모델을 적용하기 전에 주변 RNA와 기술적 오염을 제거하는 것을 요구합니다.
- 중첩 구조 변이: 모델은 중첩된 구조 서브핵타입에 대한 임상적 연관성을 평가해야 하며, 이는 용량 보정과 발현 지원이 더 넓은 역전 방향과 구분되도록 보장해야 합니다.
데이터 입력 요약
이러한 사례 연구 전반에 걸쳐 모델은 다음과 같은 원본 또는 반처리된 데이터 파일을 제공받습니다:
- 레지스트리 공변량: 환자 나이, 성별, 종양 부담, 치료 클래스.
- 유전체 좌표: 가이드 ID, 염색체 위치, GC 분수.
- 연관 요약: SNP 위치, 효과 알레일, 베타 값, p-값.
- 세포 지표: 마커 유전자와 오염 마커에 대한 세포당 UMI 수.
- 조상 데이터: 사후 값과 QC 주석이 포함된 단계별 지역 조상 tracts.
Sources
- OriginalInside Genebench-Pro