OpenAI, 오픈 가중치 LLM의 최악 상황 프론티어 위험 추정

TL;DR

OpenAI는 gpt-oss에 대한 위험 평가 기술 연구를 발표했으며, 이 모델이 기존 오픈‑가중치 모델과 비교했을 때 생물학적 위험이나 사이버 보안 위험의 프론티어를 크게 앞당기지 않는다고 결론지었습니다. 이 연구는 malicious fine-tuning (MFT) malicious fine-tuning (MFT) 라는 과정을 활용해 두 고위험 분야에서 모델 능력의 최악 상황을 테스트했습니다.

Malicious Fine-Tuning (MFT) Methodology

최악 상황 위험을 추정하기 위해 OpenAI 연구원들은 Malicious Fine-Tuning (MFT) 를 사용해 gpt-oss가 생물학 및 사이버 보안 분야에서 발휘할 수 있는 최대 능력을 의도적으로 끌어냈습니다. 이 접근법을 통해 모델의 아키텍처나 가중치가 기본 상태보다 본질적으로 더 큰 해를 끼칠 수 있는지를 판단할 수 있습니다.

Biological Risk (Biorisk) Assessment

생물학적 위험을 극대화하기 위해 연구진은 위협 생성과 관련된 작업 집합을 선별했습니다. 이후 gpt-oss를 웹 브라우징 기능이 탑재된 강화 학습 (RL) 환경에서 학습시켜, 모델이 위협 생성 과정에서 지원할 수 있는 잠재력을 시뮬레이션하도록 했습니다.

Cybersecurity Risk Assessment

사이버 보안 위험을 극대화하기 위해 gpt-oss를 캡처‑더‑플래그 (CTF) 챌린지를 해결하도록 설계된 에이전시 코딩 환경에서 학습시켰습니다. 이 모델 변형을 통해 복잡한 사이버 보안 공격을 자동화할 수 있는 모델의 잠재력을 평가했습니다.

Comparative Performance and Risk Findings

OpenAI는 MFT‑강화된 gpt-oss 모델을 폐쇄‑가중치 모델과 오픈‑가중치 LLM 모두와 비교했습니다. 평가 결과는 다음과 같습니다:

  • 폐쇄‑가중치 모델과의 비교: MFT gpt-oss는 현재 "Preparedness High" 수준 이하로 평가되는 OpenAI o3보다 성능이 낮았습니다. 이는 양쪽(생물학 위험 및 사이버 보안 위험) 모두에 해당합니다.
  • 오픈‑가중치 모델과의 비교: gpt-oss가 생물학적 능력을 약간 증가시킬 수는 있지만, 이미 공개된 기존 오픈‑가중치 모델과 비교했을 때 위험 프론티어를 크게 앞당기지는 않습니다.

Implications for Model Release

MFT 과정에서 얻은 결과는 OpenAI가 모델 공개 여부를 결정하는 데 필요한 핵심 증거를 제공했습니다. 악의적인 미세조정 하에서도 모델이 위험 임계값에 도달하지 않는다는 점을 입증함으로써, OpenAI는 향후 프론티어 모델의 오픈‑가중치 공개에 대한 해악 추정 프레임워크를 제시하고자 합니다.

Sources