Grok 4.6 생물안전 성능 및 보호 장치

TL;DR

Grok 4.6은 LatchBio의 BioSecBench-Refusal 벤치마크에서 가장 강력한 모델로, 위장된 유해 쿼리의 59.2%를 거부하고 일상적인 생물학적 작업의 64.8%를 완료하여 두 지표 모두 50% 임계값을 초과하며, 병원체 감시 워크플로우에서도 경쟁력 있는 결과를 제공합니다.


주요 기술적 발견

Grok 4.6이 BioSecBench-Refusal 벤치마크에서 선두

  • LatchBio는 데이터 파일, 파일 이름 또는 암호화에 생물안전 위험을 숨긴 46개의 레드팀 작업을 평가했습니다.
  • Grok 4.6은 이러한 유해 쿼리의 59.2%를 거부하여 테스트된 모든 프론티어 시스템 중 가장 높은 거부율을 기록했습니다.
  • 이 모델은 또한 일상적인 생물학적 작업의 64.8%를 완료하여 거부 및 준수 지표 모두에서 50% 이상을 기록한 유일한 시스템입니다.
  • Grok 4.6의 거부 및 준수에 대한 전체 시험 가중 조화 평균은 62.1%로, 모든 하네스 중 상위 3위에 해당합니다.

감시 능력은 여전히 경쟁력 있음

  • 병원체 유전체 감시 워크플로우를 측정하는 BioSecBench-Surveillance 벤치마크에서 Grok 4.6은 53.5%의 성공률을 달성했습니다.
  • 이 성능은 Opus 5 뒤에 있지만 GPT-5.6 Sol보다 앞서 있어 공중 보건 모니터링에 실질적인 유용성을 나타냅니다.

일반 생물학적 능력

  • 독립 평가(예: SpatialBench, TxBench-PP)는 Grok 4.6이 광범위한 에이전트 생물학적 작업에서 다른 프론티어 모델과 일치하거나 능가함을 보여줍니다.
  • 자세한 점수는 benchmarks.bio에서 확인할 수 있습니다.

Grok 4.6이 유해 요청을 거부하는 방법

  • 평가 추적은 모델이 텍스트 프롬프트와 주변 환경(파일 내용, 메타데이터, 암호화) 모두에 대해 추론함을 보여줍니다.
  • 추론된 의도가 명시된 요청과 충돌할 때 Grok 4.6은 불일치를 표시하고 거부합니다.
  • 명백히 무해한 작업의 경우 동일한 환경 추론 파이프라인이 안전을 확인하여 모델이 진행할 수 있도록 합니다.

Grok 4.6을 위한 보호 아키텍처

  1. 출시 전 테스트 – 생물학적 능력은 다른 위험 영역과 함께 평가되며, 제3자 감사(예: LatchBio)가 내부 평가를 보완합니다.
  2. 계층적 거부 훈련 – 모델은 의도와 위험을 추론하도록 미세 조정되어 매우 적대적인 시나리오에서 거부하는 법을 학습합니다.
  3. 추론 시간 필터 – 외부 보호 장치가 모델에 도달하기 전에 유해한 요청을 거부합니다.
  4. 행동 제어 – 런타임 메커니즘은 배포 중 안전하지 않은 작업을 추가로 제한합니다.
  5. 배포 후 모니터링 – 세션 및 사용자 수준 분석이 적대적 사용 패턴을 감지하여 지속적인 보정에 피드백을 제공합니다.

생물안전 및 과학적 발견에 대한 시사점

  • 위험 완화 – 높은 거부율은 AI 지원 위험한 생물학적 물질의 생성 또는 유포 가능성을 줄입니다.
  • 유용성 보존 – 일상적인 작업에서 50% 이상의 준수율을 유지하면 연구자와 공중 보건 관계자가 합법적인 작업에 모델을 계속 의존할 수 있습니다.
  • 미래 보호 장치 – xAI는 증가하는 모델 에이전시에 대응하기 위해 더 광범위한 사전 배포 제품군, 더 많은 제3자 감사, 더 엄격한 배포 후 모니터링을 계획하고 있습니다.
  • 과잉 거부 가능성 – 무해한 작업의 과도한 차단은 발병 감지 및 기타 중요한 건강 작업을 방해할 수 있습니다. xAI는 이 위험을 악의적 사용 촉진만큼 심각하게 취급합니다.

리소스 및 추가 자료

Sources