OpenAI Codex 컨텍스트 크기 축소 및 시스템 프롬프트 업데이트

OpenAI Codex 컨텍스트 크기 축소 및 시스템 프롬프트 업데이트

OpenAI는 Codex 모델의 컨텍스트 창(context window)을 372,000 토큰에서 272,000 토큰으로 축소했습니다. GitHub pull request를 통해 확인된 이 변경 사항은 어텐션 메커니즘(attention mechanisms)의 이차 함수적 스케일링 비용을 관리하기 위한 최적화 조치로 보이며, 동시에 치명적인 파일 시스템 오류를 방지하기 위해 시스템 프롬프트에 새로운 안전 제약 조건이 추가되었습니다.

372k에서 272k로의 컨텍스트 창 축소

Codex 모델의 최대 컨텍스트 크기가 272k 토큰으로 낮아졌습니다. 이 축소는 긴 시퀀스를 처리하는 데 드는 계산 비용 때문인 것으로 보입니다.

커뮤니티 구성원들이 언급했듯이, 순수하게 이차 함수적인 어텐션은 372k에서의 토큰 비용이 272k에서의 토큰 비용보다 훨씬 더 높음(약 87% 더 높음)을 의미합니다. 이는 토큰 처리 비용, 컨텍스트 압축(context compaction) 비용, 그리고 그로 인해 발생하는 품질 저하 사이의 트레이드오프를 생성합니다.

개발자 워크플로우에 미치는 영향

축소에 대한 사용자 반응은 특정 작업 부하 요구 사항에 따라 양극화되어 있습니다:

  • 고컨텍스트 사용자: 대규모 프로젝트, 여러 편의 연구 논문, 또는 광범위한 코딩 표준(일부 사용자는 60-80k 토큰 규모의 규칙 파일을 보고함)을 관리하는 개발자들은 272k가 불충분하다고 주장합니다. 일부 사용자는 세부 사항과 해상도 손실을 초래할 수 있는 빈번한 "압축" 사이클을 피하기 위해 300k에서 1M 토큰이 필요하다고 보고합니다.
  • 저-중간 컨텍스트 사용자: 다른 사용자들은 200k 토큰이 일반적으로 그들의 워크플로우에 충분하거나, 모델 성능을 유지하기 위해 매 200k 토큰마다 컨텍스트를 수동으로 초기화하므로 축소가 문제가 되지 않는다고 보고합니다.

컨텍스트 압축 및 성능 저하

하드 제한을 초과하는 컨텍스트를 처리하기 위해 Codex는 "압축" 전략을 사용합니다. 그러나 이 프로세스는 사용자들 사이에서 논쟁의 대상이 됩니다.

"Dumb Zone" 및 품질 저하

여러 사용자는 컨텍스트 창이 차오거나 압축이 발생한 후 모델의 지능이 저하되는 현상을 관찰했습니다:

"압축을 통해 잃게 되는 세부 사항의 수준은 제가 하는 대부분의 작업에 있어 너무나도 과도합니다... 약 5분 정도 대화를 나누면 압축이 발생하고, 그러면 다시 읽을 때까지 기다려야 합니다."

일부 사용자는 전체 창 크기와 관계없이 모델의 효과성이 떨어지는 "dumb zone"이 약 120k-150k 토큰 부근에서 시작된다고 제안합니다. 다른 이들은 압축 이후, 모델(특히 GPT 5.5 및 5.6으로 언급됨)이 원래의 속도를 회복하지 못하거나 압축 과정에서 살아남은 오래된 스티어링 메시지(steering messages)에 과도하게 집중할 수 있다고 언급합니다.

파괴적 작업에 대한 새로운 안전 제약 조건

컨텍스트 크기 변경 외에도, Codex 시스템 프롬프트에 모델이 실수로 중요한 시스템 파일을 삭제하는 것을 방지하기 위한 중요한 업데이트가 이루어졌습니다. 업데이트된 프롬프트는 이제 모델에게 다음과 같이 명시적으로 지시합니다:

  • 모든 파괴적 작업이 사용자의 요청 범위 내에 명확히 있는지 확인하십시오.
  • 필요한 경우 읽기 전용(read-only) 체크를 통해 정확한 대상을 지정하십시오.
  • $HOME, ~, /, 또는 워크스페이스 루트와 같은 광범위한 디렉터리를 재귀적 또는 파괴적 명령의 대상으로 지정하는 것을 피하십시오.

이 업데이트는 Codex가 사용자의 홈 디렉터리 전체를 가끔씩 삭제할 수 있는 버그가 보고된 이후에 이루어졌습니다.

타 모델과의 비교

커뮤니티 논의는 OpenAI의 컨텍스트 제공량과 경쟁사들의 제공량 사이의 커지는 간극극을 강조합니다:

  • Anthropic: 사용자들은 복잡한나 다중 파일 프로젝트를 위해 Codex 대신 Claude를 선호하는 주요 이유로 Claude의 더 큰 컨텍스트 창을 자주 언급합니다.
  • DeepSeek 및 기타: DeepSeek의 KV cache 기술과 다른 프론티어 모델들이 제공하는 1M+ 토큰 창을 언급하며, 272k는 전문적인 프로그래밍 작업에 있어 점점 더 제한적인 것으로 간주됩니다.

Sources