OpenAI, 생물학 분야의 미래 AI 위험에 대비 중

OpenAI는 프론티어 AI 모델과 관련된 생물학적 위험을 완화하기 위한 포괄적인 전략을 발표했습니다. 이러한 모델이 OpenAI의 준비 프레임워크에 정의된 생물학에서 'High' 수준의 능력에 다가감에 따라, 회사는 합법적인 과학적 발견을 계속 지원하면서 AI를 이용한 생물무기 생성 또는 생물학적 위협 재창출을 방지하기 위한 다층 방어 시스템을 구현하고 있습니다.

사전 완화 및 전문가 협력

OpenAI는 생물학적 위험에 대해 예방 우선 접근 방식을 채택하여 위협 사건이 발생하기 전에 유해한 능력에 대한 접근을 제한하는 데 중점을 둡니다. 이 전략은 외부 도메인 전문가 및 정부 기관과의 협력에 크게 의존하여 취약점을 식별하고 they 시스템을 강화합니다.

  • 전문가 상담: OpenAI는 생물보안, 생물무기, 생물테러 전문가 및 학계 연구원과 협력하여 위협 모델, 능력 평가 및 사용 정책을 형성했습니다.
  • 정부 파트너십: 회사는 US CAISI 및 UK AISI와 파트너십을 맺고 있으며, 로스 알라모스 국립 연구소와 협력하여 습식 실험실 환경에서 AI의 역할을 연구했습니다.
  • 검증: 생물학 박사 및 석사 학위를 가진 인간 트레이너는 안전 평가의 정확성을 보장하기 위해 평가 데이터를 생성하고 검증하는 데 사용됩니다.

생물학적 위험에 대한 기술적 안전 조치

AI의 생물무기화 오용을 방지하기 위해 OpenAI는 제품 전반에 여러 가지 기술적 통제를 배포했습니다:

모델 훈련 및 응답 필터링

OpenAI는 명백히 유해한 요청이나 생물무기화를 가능하게 하는 요청을 거부하도록 모델을 훈련시킵니다. 유전자 공학, 면역학, 바이러스학과 관련된 이중 용도 요청—예를 들어—의 경우, 모델은 실행 가능한 단계별 지침이나 습식 실험실 문제 해결 지침을 제공하지 않는 Model Spec을 따릅니다. 목표는 전문가에게 높은 수준의 통찰력을 제공하면서 초보자가 시스템을 오용할 수 있는 세부 정보는 retenir하지 않는 것입니다.

  • 항시 모니터링: 시스템 전체 모니터가 위험하거나 의심스러운 바이오 관련 활동을 감지합니다. 요청이 안전하지 않다고 플래그가 지정되면 응답이 차단되고 자동 검토가 트리거되며, 이는 인간 검토로 이어질 수 있습니다.
  • 정책 시행: OpenAI는 해를 끼치는 제품 사용을 금지합니다. 오용은 계정 정지로 이어질 수 있으며, 심각한 경우에는 법 집행 기관에 알림이 갈 수 있습니다.

레드 팀링 및 보안 통제

  • 종단 간 레드 팀링: OpenAI는 생물학 도메인 전문가와 경험이 풍부한 레드 팀러를 짝지어 정교한 적을 시뮬레이션하고 안전 시스템의 격차를 식별합니다.
  • 가중치 보호: 심층 방어 접근 방식은 접근 제어, 인프라 강화, 이그레스 제어 및 모니터링을 결합하여 Insider-Risk 프로그램의 지원을 받으며 모델 가중치의 유출을 방지하는 데 사용됩니다.

미래 생물보안 이니셔티브

OpenAI는 개별 모델을 보호하는 것만으로는 부족함을 인식하고 있으며, 보다 광범위한 생물학적 방어 생태계를 옹호하고 있습니다.

생물방어 및 검증된 접근

7월에 OpenAI는 정부 연구원 및 NGO와 함께 생물방어 정상 회의를 개최하여 프론티어 모델이 대응책 및 새로운 치료법 개발을 어떻게 가속화할 수 있는지 탐구할 것입니다. 또한, 회사는 생물 과학을 발전시키기 위해 더 유능한 모델에 대한 접근을 검증된 기관에 부여하는 프로토콜을 개발하고 있습니다.

체계적 생물학적 방어

OpenAI는 공공 및 민간 부문이 AI 모델 외부의 생물학적 방어를 강화하기 위해 협력할 것을 제안하며, 다음을 포함합니다:

  • 핵산 합성 검사 강화.
  • 새로운 병원체에 대한 보다 강력한 조기 탐지 시스템.
  • 생물 위협에 대한 인프라 강화.
  • 장기적인 회복력을 보장하기 위한 생물보안 혁신 및 미션 중심 스타트업에 대한 투자.

Sources