OpenAI Codex 에이전트가 버전 0.144.0-alpha.4의 버그로 인해 7만 8천 달러의 무단 사용료를 발생시켰습니다
사고 개요
OpenAI Codex 작업이 826개의 병렬 하위 에이전트를 실행하여 약 2,146조 개의 토큰을 소비했으며, 사용자 승인 없이 약 78,000달러의 비용이 발생했습니다. 이 동작은 Codex 클라이언트 버전 0.144.0-alpha.4의 버그로 인해 발생한 것으로 추적되었으며, 이 버그는 대규모의 토큰 집약적인 하위 작업을 생성하고 UI나 결제 대시보드에 이를 보고하지 못했습니다.
비정상 실행의 기술적 세부 사항
- 루트 작업: ID
019f4b90-4169-7201-bfdd-732940d8631e, 모델GPT‑5.5(추론 수준: Medium). - 하위 작업: 826개의 개별 레코드, 각각 새로운 ID가 할당되고
GPT‑5.6 Sol / Ultra(더 높은 추론 수준)로 업그레이드됨. - 고용량 하위 집합: 해당 하위 작업 중 104개는 원래 프롬프트를 복제했으며
agent_role/agent_path가 누락되었고, 이들만으로 약 1,479억 개의 로컬 토큰 카운터가 기록됨. - 토큰 분포:
- 클라이언트 빌드
0.144.0-alpha.4사용 시: 584개의 하위 작업, 약 1,543.6억 개의 로컬 토큰 (작업당 약 2억 6,430만 토큰). - 클라이언트 빌드
0.144.2사용 시: 242개의 하위 작업, 약 75.1억 개의 로컬 토큰 (작업당 약 3,100만 토큰). - 평균 토큰 용량이 8.5배 증가한 것은 알파 빌드와 상관관계가 있으며, 이는 토큰 사용량을 부풀리고 추가 에이전트를 생성하는 심각한 버그가 있음을 나타냄.
- 클라이언트 빌드
- 결제 영향: 사용자가 재구성한 OpenAI 청구서에 따르면 총 79,664.88달러에 달하는 162개의 결제 내역이 확인됨 (자동 충전 및 크레딧 포함). 공식 OpenAI 결제 원장에는 이러한 내부 카운터에 대한 정확한 토큰-달러 매핑이 공개되지 않음.
- 데이터 손실: 대부분의 원시 롤아웃 로그가 사용자 기기에서 삭제되었으며, 상세한 실행 기록 없이 약 2,550개의 레거시 스레드에 대한 메타데이터만 남음.
기존 제어 장치가 실패한 이유
- 지출 한도 없음: 사용자의 OpenAI 계정에 하드 지출 한도가 설정되어 있지 않아, 통제되지 않은 사용량이 계속될 수 있었음.
- 알림 누락: 대규모 지출 급증에 대한 OpenAI의 일반적인 이메일 알림이 트리거되지 않았는데, 이는 알림 파이프라인의 오류이거나 사용량이 공개 결제 시스템과 연결되지 않은 내부 카운터에만 기록되었음을 시사함.
- 클라이언트 측 버그: 알파 클라이언트 버전이 자율적으로 하위 작업을 생성하고 토큰 카운터를 부풀려, 클라이언트 측의 비용 가시성 UI를 우회함.
"사용자가 어떤 수준에서도 지출 보호 기능을 활성화하지 않은 것이 분명합니다. OpenAI나 은행의 제어 장치가 전혀 작동하지 않았거나, 실제로 발송되는 알림 이메일조차 오지 않았다는 것은 말이 되지 않습니다." – @OutOfHere (HN 댓글)
커뮤니티 반응 및 통찰
- 지출 한도 질문: 여러 댓글 작성자가 OpenAI가 계정 수준의 한도를 제공하는지, 그리고 왜 설정되어 있지 않았는지 질문함.
- 회의론: 일부 사용자는 이 주장이 공포 조장이나 투표 조작일 가능성이 있다며 의구심을 표함.
- 유사 버그 관찰: 한 댓글 작성자는 Claude에서도 유사한 하위 에이전트 폭주 사례를 보고하며, 하드 한도만으로는 충분하지 않으며 관측 도구(예: AgentCost, Langfuse)가 필요하다고 언급함.
- 로그 공유 요청: 원작자는 다른 Codex 사용자들이 버전 0.144.0-alpha.4의 로그를 공유하여 패턴을 확인할 것을 요청함.
실무자를 위한 권장 사항
- 모든 OpenAI 계정에 엄격한 지출 한도를 설정하십시오. 특히 실험적인 클라이언트 빌드를 사용할 때는 더욱 중요합니다.
- 로컬 카운터에 의존하지 말고 서버 측 도구로 토큰 사용량을 모니터링하십시오. 로컬 카운터는 삭제되거나 손상될 수 있습니다.
- 안정적인 클라이언트 릴리스를 선호하십시오. 프로덕션 워크로드에는 알파 또는 사전 릴리스 빌드를 피하십시오.
- 작업별 토큰 수와 비용을 실시간으로 보여주는 관측 플랫폼(예: Langfuse, AgentCost)을 통합하십시오.
- OpenAI의 감사 로그를 통하거나 요청/응답 데이터를 쓰기 전용 저장소로 내보내는 방식으로 API 호출에 대한 변경 불가능한 로그를 유지하십시오.
OpenAI의 대응
사용자는 지원 사례 #15189838을 열고 기술적 증거를 제공했습니다. OpenAI의 답변은 "크레딧이 소모되었다"는 일반적인 진술에 그쳤으며, 비정상 작업에 대한 상세한 재구성은 제공하지 않았습니다.
결론
이번 사건은 알파 Codex 릴리스의 클라이언트 측 버그가 지출 한도가 없을 때 어떻게 통제되지 않은 하위 에이전트 생성, 대규모 토큰 소비, 상당한 재정적 손실을 유발할 수 있는지 보여줍니다. 강력한 비용 제어, 안정적인 소프트웨어 릴리스, 서버 측 관측 가능성은 유사한 AI 실행 폭주를 방지하기 위한 필수적인 안전 장치입니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch