OpenAI 프롬프트 캐싱 API 출시
OpenAI는 최근에 본 입력 토큰을 재사용함으로써 비용과 지연 시간을 줄일 수 있는 프롬프트 캐싱 기능을 출시했습니다. 이 기능은 특히 길고 다중 턴 대화나 대규모 코드베이스에 대한 반복적인 편집이 필요한 애플리케이션에 유용합니다.
프롬프트 캐싱 가격 및 모델 가용성
프롬프트 캐싱은 GPT-4o, GPT-4o mini, o1-preview, o1-mini의 최신 버전과 해당 파인튜닝 버전에 자동으로 적용됩니다. 캐시된 입력 토큰은 캐시되지 않은 입력 토큰에 비해 50% 할인된 가격으로 제공됩니다.
| 모델 | 비캐시 입력 토큰 | 캐시 입력 토큰 | 출력 토큰 |
|---|---|---|---|
| gpt-4o-2024-08-06 | $2.50 | $1.25 | $10.00 |
| GPT-4o 파인튜닝 | $3.75 | $1.875 | $15.00 |
| gpt-4o-mini-2024-07-18 | $0.15 | $0.075 | $0.60 |
| GPT-4o mini 파인튜닝 | $0.30 | $0.15 | $1.20 |
| o1-preview | $15.00 | $7.50 | $60.00 |
| o1-mini | $3.00 | $1.50 | $12.00 |
기술 구현 및 캐시 로직
프롬프트 캐싱은 1,024 토큰보다 긴 프롬프트에 자동으로 적용됩니다. 시스템은 최소 1,024 토큰부터 시작하여 128 토큰씩 증가시키면서, 이전에 계산된 가장 긴 프롬프트 접두사를 캐시합니다.
개발자는 할인 혜택을 받기 위해 API 통합을 변경할 필요가 없으며, 시스템이 일반적인 접두사를 자동으로 식별하고 캐싱을 적용합니다.
캐시 모니터링 및 수명 주기
API 응답에는 이제 usage 필드 내에 cached_tokens 값이 포함되어, 개발자가 캐시 사용량을 모니터링할 수 있습니다.
캐시는 비활성 기간을 기준으로 관리됩니다:
- 일반적으로 5~10분간 비활성 상태가 되면 캐시가 삭제됩니다.
- 마지막 사용 후 1시간 이내에 캐시는 반드시 제거됩니다.
프라이버시 및 보안
프롬프트 캐시는 조직 간에 공유되지 않으며, 캐시된 데이터가 격리된 상태로 유지됩니다. 이 기능은 OpenAI의 엔터프라이즈 프라이버시 약속에 따라 제공됩니다.
Sources
- OriginalPrompt Caching in the API