OpenAI GPT-6 프롬프트 캐시 업데이트
OpenAI는 복잡한 다단계 작업을 수행하는 지속 가능한 에이전트를 지원하기 위해 GPT-6 시리즈 모델용 개선된 프롬프트 캐시 시스템을 출시했습니다. 이 시스템은 응답 시간을 단축하고, API 요청 간에 공유된 컨텍스트를 재사용함으로써 캐시된 입력 토큰에 대해 최대 90% 할인을 제공합니다.
개선된 캐시 히트율과 가격 정책
GPT-6는 기본적으로 더 높은 캐시 히트율을 제공하는 캐시 시스템을 구현합니다. 이 시스템은 30분 이내에 재사용되는 유효한 공유 접두사에 대해 캐시 할인을 제공합니다.
모니터링 및 진단 도구
OpenAI는 개발자가 캐시 성능을 관리하고 최적화하는 데 도움을 주기 위해 두 가지 새로운 도구를 도입했습니다:
- 프롬프트 캐시 대시보드: 시간에 따른 히트율을 추적하고, 캐시된 토큰과 캐시되지 않은 토큰을 비교할 수 있는 입력 구성 차트를 제공하는 도구입니다.
- 프롬프트 캐시 진단 도구: 예기치 않은 캐시 미스를 조사하기 위한 유틸리티입니다. 요청과 최근 응답을 비교하여 모델, 도구, 설정 또는 입력의 변경이 재사용을 방지했는지 확인할 수 있습니다. 도구는 영향을 받는 토큰 수를 추정하여 캐시 미스의 영향을 평가하는 데 도움을 줍니다.
GPT-6 캐시 최적화 전략
개발자는 여러 가지 새로운 제어 기능을 활용하여 캐시 히트율을 극대화하고 지연 시간을 줄일 수 있습니다.
명시적 캐시 점검 지점
개발자는 명시적 캐시 점검 지점을 사용하여 어떤 프롬프트 접두사를 재사용할지 선택할 수 있으며, 캐시되는 내용에 대해 더 세밀한 제어가 가능합니다.
동적 추론 노력 조정
GPT-6 모델에서는 캐시를 깨지 않고도 응답 간 추론 노력 수준을 변경할 수 있습니다. 요청 수준의 추론 노력은 그대로 두고 configuration_update를 추가함으로써 추론 강도를 작업의 난이도에 따라 조정할 수 있으며, 재사용 가능한 컨텍스트를 잃지 않습니다.
안정적인 도구 및 지시사항 관리
도구와 지시사항이 진화함에 따라 캐시를 유지하기 위해 OpenAI는 도구 정의, 스키마 및 순서를 안정적으로 유지하는 것을 권장합니다. 개발자는 다음과 같이 해야 합니다:
- 도구 정의를 제거하는 대신
allowed_tools을 사용하여 호출 가능한 도구를 제한하세요. - 도구가 필요하지 않을 때는
tool_choice를none으로 설정하세요. - 개발자 메시지를 사용하여 컨텍스트 끝에 새로운 지시사항을 추가하여 오래된 지시사항을 덮어쓰세요.
캐시 사전 준비
사전 준비를 통해 응용 프로그램은 미리 알려진 컨텍스트(예: 공유 지시사항, 도구 정의 또는 참고 자료)를 미리 준비할 수 있습니다. 이를 통해 사용자의 대기 시간 동안 컨텍스트 처리를 이동시켜 초기 응답 지연을 줄일 수 있습니다.
Sources
- OriginalBetter prompt caching for GPT-6