GPT-5.1-Codex-Max 시스템 카드

OpenAI는 복잡한 소프트웨어 엔지니어링, 수학, 연구 작업을 위한 프론티어 에이전틱 코딩 모델인 GPT-5.1-Codex-Max를 도입했습니다. 이 모델은 컴팩션이라고 하는 프로세스를 사용하여 여러 컨텍스트 윈도우에서 작동할 수 있는 능력을 갖추고 있어, 단일 작업에서 수백만 토큰에 걸쳐 일관성을 유지할 수 있습니다.

모델 아키텍처 및 훈련

GPT-5.1-Codex-Max는 OpenAI의 기초 추론 모델의 업데이트를 기반으로 구축되었습니다. 이 모델은 소프트웨어 엔지니어링, 의학, 컴퓨터 사용 등 여러 분야에서 에이전틱 작업을 처리하도록 네이티브로 훈련되었습니다. 실제 소프트웨어 엔지니어링 워크플로에서의 성능을 최적화하기 위해, 모델은 풀 요청(PR) 생성, 코드 리뷰, 프론트엔드 코딩, 기술 Q&A와 같은 작업에 대해 훈련되었습니다.

안전 및 완화 전략

OpenAI는 오용 및 취약성에 대비하기 위한 포괄적인 안전 조치 세트를 구현했습니다. 이러한 완화 조치는 두 가지 주요 범주로 나뉩니다.

모델 수준 완화

모델 수준 보호는 모델이 해로운 작업을 수행하지 못하도록 하고 프롬프트 주입에 저항하도록 특별히 목표를 둔 특화된 안전 훈련을 포함합니다.

제품 수준 완화

제품 수준 보호는 모델의 에이전틱 기능이 통제된 환경에서 실행되도록 보장하기 위해 에이전트 샌드박스 및 구성 가능한 네트워크 접근을 포함합니다.

준비도 프레임워크 평가

GPT-5.1-Codex-Max는 OpenAI의 준비도 프레임워크를 사용하여 잠재적 위험을 평가했습니다. 결과는 다음과 같습니다.

  • Cybersecurity: 이 모델은 사이버 보안 분야에서 매우 유능하다고 설명되지만, 현재 'High' 능력 임계값에 도달하지는 못합니다. OpenAI는 능력이 계속 향상됨에 따라 미래 모델이 이 임계값을 likely crosses할 것으로 기대합니다.
  • Biology: 이 모델은 생물학 분야에서 'High' 능력으로 간주되며, 따라서 GPT-5에 사용된 것과 동일한 보호 조치로 배포됩니다.
  • AI Self-Improvement: 이 모델은 AI 자체 개선에 대한 'High' 능력 임계값에 도달하지 못합니다.

Sources