Anthropic, gget virus 발표: 결정론적 검색 레이어가 바이러스 유전자 서열 데이터에 대한 AI 에이전트 정확도 향상
요약
Anthropic는 gget virus를 출시하여 NCBI Virus에 대한 결정론적 검색 레이어를 제공함으로써, 바이러스 유전자 서열 검색 작업에서 AI 에이전트의 정확도를 99% 이상으로 끌어올렸으며, 신뢰할 수 있는 데이터 접근 도구가 신뢰할 수 있는 생물학적 AI 에이전트를 위해 필수적임을 입증했다.
핵심 문제: 취약한 생물학적 데이터 인프라
- 생물학적 데이터베이스(예: NCBI Virus)는 자율 에이전트가 아닌 인간 사용자를 위해 설계되었다.
- 다양한 파일 형식, 분산된 API, 문서화되지 않은 필터링 로직은 인간에게는 쉬운 ‘클릭 세금’ 워크플로우를 만들지만, AI 에이전트에게는 오류가 발생하기 쉬운 구조이다.
- 최신 과학적 에이전트(예: Claude Sonnet 4, Claude Opus 4.7, Biomni OSS, Edison Analysis, GPT-5.2-pro, GPT-5.5)도 실제 바이러스 서열 쿼리에서 평균 정확도가 16.9%–91.3% 사이에 머물며, 실행 간 변동성이 크다.
- 작은 검색 오류(예: 잘못된 게놈 빌드, 누락된 레코드)는 계통발생 TMRCA 추정이나 치료적 에피토프 분석과 같은 후속 결론을 극적으로 왜곡할 수 있다.
사례 연구: NCBI Virus에서의 VirBench 벤치마크
- VirBench는 40개 병원체에 걸쳐 120개의 쿼리로 구성되며, 각 쿼리는 수작업으로 검증된 참값 카운트를 제공한다.
- 예시 쿼리: 2014년 1월 1일~2014년 6월 20일 사이에 아프리카의 인간 숙주에서 분리된 Orthoebolavirus zairense 서열을 검색하되, 길이 ≥ 15,200 bp이고 N의 수 ≤ 1,900개여야 한다.
- 결정론적 지원이 없는 에이전트는 일관되지 않은 카운트를 반환했다(예: Claude Sonnet 4는 세 번의 동일한 실행에서 각각 106, 15, 5개의 서열을 반환).
- 결과로 생성된 계통발생 트리의 TMRCA 추정치는 1922년에서 2014년까지 범위를 보였으며, 검색 누락이 과학적 추론을 왜곡함을 보여준다.
"코드는 가장 쉬운 부분이었어요! 대부분의 작업은 브라우저에서 클릭하는 데 들였죠." – Andrej Karpathy, 에이전트와 인간 중심 도구 간의 광범위한 부조화를 설명하기 위해 인용됨.
gget virus 소개
- NCBI와 협력하여 NCBI Virus 웹 인터페이스의 동작을 프로그래밍적으로 재현하도록 개발됨.
- 여러 하위 리소스(REST, Datasets, E-utilities)를 조율하고, API가 필요한 의미를 제공하지 못할 경우 로컬에서 필터를 적용함.
- 배치 처리를 통해 대규모 결과 집합을 처리하고, 식별자 불일치를 해결하며, 표준화된 출력에 메타데이터(예: GenBank 필드)를 유지함.
- 검색 과정을 감사 가능하고 재현 가능하게 만들기 위해 상세한 로그를 생성함.
에이전트 성능에 미치는 영향
| 에이전트 | gget virus 없이 평균 정확도 | gget virus 있음 평균 정확도 |
|---|---|---|
| Claude Sonnet 4 | 91.3% (변동성 있음) | 99.5% |
| Claude Opus 4.7 | 88.7% | 99.6% |
| Biomni OSS | 84.2% | 99.3% |
| Edison Analysis | 78.5% | 99.2% |
| GPT-5.2-pro | 85.1% | 99.4% |
| GPT-5.5 | 89.9% | 99.7% |
- gget virus를 추가함으로써 실행 간 변동성이 대부분 제거되었으며, 모델 간 성능 격차가 크게 좁혀졌다.
- 이 결과는 결정론적 검색이 모델 크기보다 신뢰할 수 있는 생물학적 데이터 파이프라인의 제한 요소임을 보여준다.
결정론적 레이어의 중요성
- 생물학적 워크플로우는 거의 완벽한 재현을 요구한다. 단 하나의 누락된 서열도 유행 시기 추정이나 치료 효과 평가를 잘못 이끌 수 있다.
- 결정론적 도구는 기존 생물정보학 포털의 조각난 ‘보행자 길’ 위에 재현 가능한 ‘고속도로 터널’을 제공한다.
- 저비용 모델도 전문가 수준의 신뢰성을 달성할 수 있게 하여, AI 보조 연구의 비용을 낮추고 접근성을 넓힌다.
AI 기반 과학에 대한 더 넓은 함의
- 에이전트의 능력과 기존 인프라 간의 괴리는 다른 분야(예: 웹 개발)에서도 나타나는 문제와 유사하며, Karpathy의 강연에서 강조된 바 있다.
- 모델이 향상될수록 채택의 필요성은 줄어들 수 있지만, 감사 가능성, 속도, 비용 효율성 측면에서 결정론적 인터페이스는 여전히 가치가 있다.
- 미래의 데이터베이스 설계는 반드시 에이전트 친화적인 API, 표준화된 식별자, 버전 관리된 메타데이터를 우선시하여 ‘클릭 세금’을 완전히 제거해야 한다.
다음 단계 및 열린 과제
- 결정론적 레이어 접근법을 다른 분야(예: 단백질 구조 저장소, 대사체학 데이터베이스)로 확장하기.
- ‘에이전트 준비형’ 데이터 서비스를 위한 커뮤니티 기준 개발, 명시적인 스키마 버전 관리 및 머신 액션 가능한 문서 포함.
- 빠르게 향상되는 모델이 결정론적 도구와 어떻게 상호작용하는지 모니터링하고, 도구-모델 공진화가 지연 시간과 비용을 더 줄일 수 있는지 평가하기.
감사의 말: 저자들은 Xander Balwit, Ethan Dyer, Stuart Ritchie, Rebecca Hiscott, Alyssa Morrow, Keir Bradwell, Eric Kauderer-Abrams, Jonah Cool, Andrej Karpathy, Patrick Varilly, Cesar Arze, Blake Lash, Philine Guckelberger, Nisha Gopal, Elliot Hershberg, Pardis Sabeti, Jonathan Feldman, Sarah Gurev, Gage Moreno, Ferdous Nasri, Krithik Ramesh 등이 피드백과 기여를 해주어 감사하다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- 프로젝트
- Dispatch