OpenAI gpt-oss-120b 및 gpt-oss-20b 출시

OpenAI는 에이전시 워크플로를 위해 설계된 두 개의 오픈-웨이트 추론 모델인 gpt-oss-120b와 gpt-oss-20b를 출시했습니다. 이 모델들은 Apache 2.0 라이선스와 gpt-oss 사용 정책에 따라 제공되며, 오픈소스 커뮤니티에 강력한 명령 수행, 도구 사용 및 맞춤형 추론 노력을 위한 도구를 제공합니다.

모델 기능 및 통합

gpt-oss 모델은 텍스트 전용 추론 모델로, 구조화된 출력(Structured Outputs)을 지원하고 전체 사고 흐름(chain-of-thought, CoT) 가시성을 제공합니다. 이 모델들은 에이전시 워크플로에 통합되도록 설계되었으며, 특히 파이썬 코드 실행 및 웹 검색과 같은 도구 사용을 지원합니다.

주요 기술 특징은 다음과 같습니다:

  • Customizability: 모델은 특정 요구에 맞게 맞춤 설정할 수 있습니다.
  • Instruction Following: 복잡한 명령을 따르는 강력한 능력을 갖추고 있습니다.
  • Reasoning Effort: 사용자는 복잡한 추론이 필요하지 않은 작업에 대해 추론 노력을 조정할 수 있습니다.
  • API Compatibility: 모델은 OpenAI Responses API와 호환됩니다.

안전 및 위험 평가

오픈-웨이트 모델은 제3자에 의해 파인튜닝되어 안전 거부를 우회할 수 있기 때문에, OpenAI는 이를 독점 모델과 다른 위험 프로파일을 가진 것으로 간주합니다. OpenAI는 이러한 모델을 구현하는 개발자와 기업이 OpenAI의 독점 API 제품에서 제공되는 보호 기능을 복제하기 위해 자체 시스템 수준 보호 조치를 구현해야 한다고 언급합니다.

이 모델들의 위험을 평가하기 위해 OpenAI는 Preparedness Framework를 사용해 gpt-oss-120b에 대한 확장 가능한 능력 평가를 수행했습니다. 평가는 생물·화학 능력, 사이버 능력, AI 자체 개선이라는 세 가지 추적 카테고리에 초점을 맞추었습니다. 결과는 기본 모델이 이들 카테고리 중 어느 하나에서도 “고능력(High capability)” 임계값에 도달하지 못함을 확인했습니다.

적대적 테스트 및 오픈 모델 프론티어

OpenAI는 공격자가 gpt-oss-120b를 수정하여 생물·화학 또는 사이버 분야에서 고능력(High capability)에 도달할 수 있는지 확인하기 위해 적대적 파인튜닝 시뮬레이션을 수행했습니다.

조사 결과는 다음과 같습니다:

  • Adversarial Fine-tuning: OpenAI의 학습 스택을 사용한 강력한 파인튜닝을 적용했음에도 불구하고, gpt-oss-120b는 생물·화학 위험 또는 사이버 위험에서 고능력에 도달하지 못했습니다.
  • Comparison to Existing Models: gpt-oss-120b의 출시가 오픈 기반 모델의 생물학적 능력 프론티어를 크게 앞당긴 것은 아니며, 기존 오픈 모델들의 기본 성능이 종종 적대적 파인튜닝된 gpt-oss-120b의 성능과 일치합니다.

OpenAI는 이번 출시가 유익한 AI를 발전시키고 AI 생태계 전반의 안전 기준을 높이기 위한 약속의 일환이라고 밝혔습니다.

Sources