앤트로픽 LLM과 생물학적 위험: 인공지능 기반 생물학적 위협 평가
요약
앤트로픽은 클로드 오퍼스 4 모델에 AI 안전 수준 3(ASL-3) 보호 기능을 활성화하여 화학, 생물학, 방사선, 핵무기 개발을 도와주지 않도록 했으며, 대규모 언어 모델(LLM)이 생물학적 위험을 어떻게 증폭시킬 수 있는지와 이를 완화할 수 있는 방법에 대한 포괄적인 분석을 발표했다.
왜 ASL-3 보호 기능이 중요한가
앤트로픽은 클로드 오퍼스 4를 출시할 때 성능 향상으로 인해 기본 과학기술(STEM) 배경을 가진 개인이 CBRN 무기를 개발하려는 시도 시 모델이 이를 도울 가능성이 더 이상 배제할 수 없게 되었다고 판단하여 ASL-3 보호 기능을 활성화했다. 이 보호 기능은 생물학적 무기화를 위한 지침, 설계, 또는 세부 지식을 요청하는 질의를 차단하는 데 초점을 맞추고 있다.
"우리 평가에서 모델 성능을 향상시킨 결과, 우리 최고 수준의 모델이 기본 STEM 배경을 가진 사람들을 도울 수 있다는 가능성을 더 이상 확신 있게 배제할 수 없게 되었다. 그 잠재적 결과를 고려해, 우리의 평가와 관련 안전 조치의 주요 초점은 생물학적 무기였다." – 앤트로픽, LLMs and biorisk
LLM이 생물학적 무기에 어떻게 영향을 미치는가
인공지능이 현대의 정보 통로로
역사적으로 테러 조직들은 인쇄된 매뉴얼에서 온라인 검색으로 무기 제작 지침을 찾는 방식으로 전환해왔다. 앤트로픽은 인공지능이 다음 단계가 될 것이라고 주장한다. 즉, 모순되는 인터넷 콘텐츠를 필터링하고 실시간 안내를 제공하며 실행 가능한 프로토콜을 생성할 수 있는 대화형 보조자다.
생물학의 독특한 위험성
- 고위험 결과 – 성공적인 바이러스 공격은 대부분의 전통적 무기와 달리 전 세계로 확산될 수 있다.
- 물질적 장벽 감소 – 핵산 합성 비용, 표준화된 시약 키트, 저렴한 PCR 장비의 가격이 하락하면서 특수 공급망이 필요 없게 되었다. 인공지능은 여전히 남아 있는 정보적 장벽까지 더욱 약화시킨다.
모델 지식과 전문가 지식의 차이
LLM은 과학 논문, 교과서, 온라인 토론 등 광범위한 코퍼스를 학습하여 넓은 생물학 지식 기반을 갖추고 있다. 앤트로픽 내부 평가 결과, 클로드의 전문 기준 평가에서의 성능은 전문가 수준에 도달하거나 이를 초과하는 수준에 이르렀다.
바이러스학 문제 해결 기준(VCT)
일 년 만에 클로드는 세계적 전문가보다 낮은 성능을 보였던 상태에서, SecureBio가 설계한 바이러스학 문제 해결(VCT) 평가에서 전문가 수준을 훨씬 초과하는 성능을 보였다.

그림 1. 클로드의 VCT 성능을 보여주는 그래프로, 전문가 수준 점수로 급격히 상승함을 보여줌.
다른 여러 분자생물학 기준에서도 동일한 추세가 나타나며, LLM이 전문가 수준의 폭과 깊이를 갖출 수 있음을 시사한다.
실질적 성능 향상 증거
앤트로픽은 참가자들이 2일 동안 생물학적 무기 확보 계획을 작성하는 통제된 시험을 실시했다.
- 대조군: 표준 인터넷 자원만 접근 가능.
- 처리군: 동일한 자원에 더해 클로드 4(연구를 위해 일시적으로 보호 기능 제거).
생물방어 전문가가 평가한 결과, 클로드를 사용한 그룹이 더 높은 전반적인 점수와 더 적은 핵심 실패를 기록했다.

그림 2. (상단) 성능 향상 시험의 원시 점수; (하단) 핵심 실패 수. 클로드를 사용한 그룹이 뚜렷하게 더 우수한 성과를 보임.
앤트로픽은 텍스트 기반의 성능 향상 시험이 실제 실험실 작업의 완벽한 대체물은 아니지만, 비전문가가 전문가 수준의 안내를 얻을 수 있는 타당한 경로를 보여준다고 지적한다.
실험실 수준 실험
2024년 초 소규모 실험실 프로토콜(n = 8)에서 클로드를 사용하는 그룹과 인터넷 자원만 사용하는 그룹을 비교했다. 통계적으로 유의미한 성능 향상은 관찰되지 않았지만, 두 그룹 모두 예상보다 높은 성과를 보여, 암묵적 실험실 지식이 예상보다 더 큰 장벽이 아닐 수 있음을 시사한다.
앤트로픽은 현재 프론티어 모델 포럼(Frontier Model Forum)과 센티넬 바이오(Sentinel Bio)와 함께 더 큰 실험실 연구를 공동 주관하여 체계적으로 평가할 계획이다:
- 비전문가의 실제 실험 작업에서의 기초 성능.
- 인공지능 지원이 제공될 때의 점진적 성능 향상.
확장된 시험은 암묵적 지식의 역할과 인공지능 기반 위험의 규모를 명확히 할 것이다.
완화 전략
정보 공유와 공공-민간 협력
앤트로픽은 생물방어 전문가, 미국 AI 기준 및 혁신 센터(CAISI), 영국 AI 보안 연구소와의 지속적인 협의를 강조한다. 투명한 책임 있는 확장 정책과 위험한 능력 평가의 공개를 주장한다.
자동화된 배포 보호 기능
- 헌법 분류기는 실시간으로 입력/출력을 모니터링하고, 특정 유형의 해로운 정보를 차단한다.
- ASL-3 보호 기능은 현재 예방 조치 차원에서 클로드 오퍼스 4 계열에만 적용된다(자세한 ASL-3 보고서 참조).
- 보호 팀은 플랫폼 활동을 지속적으로 모니터링하여 오용 패턴을 감지하고 정정 조치를 시행할 수 있다.
국가 정책 일치
앤트로픽은 미국 AI 행동 계획이 생물안보에 초점을 맞추고 있으며, 핵산 합성 스크리닝 강화와 CAISI 주도의 보안 평가를 포함한다고 환영한다. 정부와 산업계의 조율된 노력이 인공지능 기반 생물학적 위험에 대한 회복력을 구축하는 데 필수적이라고 설명한다.
관련 앤트로픽 연구
Sources
- OriginalLLMs and biorisk
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch