OpenAI 프롬프트 캐싱 API 출시

OpenAI는 최근에 본 입력 토큰을 재사용함으로써 비용과 지연 시간을 줄일 수 있는 프롬프트 캐싱 기능을 출시했습니다. 이 기능은 특히 길고 다중 턴 대화나 대규모 코드베이스에 대한 반복적인 편집이 필요한 애플리케이션에 유용합니다.

프롬프트 캐싱 가격 및 모델 가용성

프롬프트 캐싱은 GPT-4o, GPT-4o mini, o1-preview, o1-mini의 최신 버전과 해당 파인튜닝 버전에 자동으로 적용됩니다. 캐시된 입력 토큰은 캐시되지 않은 입력 토큰에 비해 50% 할인된 가격으로 제공됩니다.

모델 비캐시 입력 토큰 캐시 입력 토큰 출력 토큰
gpt-4o-2024-08-06 $2.50 $1.25 $10.00
GPT-4o 파인튜닝 $3.75 $1.875 $15.00
gpt-4o-mini-2024-07-18 $0.15 $0.075 $0.60
GPT-4o mini 파인튜닝 $0.30 $0.15 $1.20
o1-preview $15.00 $7.50 $60.00
o1-mini $3.00 $1.50 $12.00

기술 구현 및 캐시 로직

프롬프트 캐싱은 1,024 토큰보다 긴 프롬프트에 자동으로 적용됩니다. 시스템은 최소 1,024 토큰부터 시작하여 128 토큰씩 증가시키면서, 이전에 계산된 가장 긴 프롬프트 접두사를 캐시합니다.

개발자는 할인 혜택을 받기 위해 API 통합을 변경할 필요가 없으며, 시스템이 일반적인 접두사를 자동으로 식별하고 캐싱을 적용합니다.

캐시 모니터링 및 수명 주기

API 응답에는 이제 usage 필드 내에 cached_tokens 값이 포함되어, 개발자가 캐시 사용량을 모니터링할 수 있습니다.

캐시는 비활성 기간을 기준으로 관리됩니다:

  • 일반적으로 5~10분간 비활성 상태가 되면 캐시가 삭제됩니다.
  • 마지막 사용 후 1시간 이내에 캐시는 반드시 제거됩니다.

프라이버시 및 보안

프롬프트 캐시는 조직 간에 공유되지 않으며, 캐시된 데이터가 격리된 상태로 유지됩니다. 이 기능은 OpenAI의 엔터프라이즈 프라이버시 약속에 따라 제공됩니다.

Sources