캐시 과금
GPT, Claude, Gemini 시리즈는 프롬프트 캐싱(Prompt Caching)을 지원합니다: 반복되는 긴 접두사(예: 시스템 프롬프트, 긴 문서)가 캐시에 히트되면, 해당 입력 부분은 캐시 배율 할인으로 과금되며 지연 시간도 눈에 띄게 감소합니다.
캐시 히트 방법
- 변하지 않는 내용을 메시지 맨 앞에 배치하고(system 프롬프트, 참조 문서), 변하는 사용자 입력은 맨 뒤에 배치합니다;
- 짧은 시간 내에 동일한 접두사로 반복 호출하면 히트되며, 추가 파라미터는 필요하지 않습니다;
- 접두사에는 최소 길이 기준이 있으며(보통 약 1K 토큰), 너무 짧으면 캐시가 생성되지 않습니다.
히트 확인 방법
응답 usage의 캐시 필드:
{ "usage": { "prompt_tokens": 5210, "completion_tokens": 84, "prompt_tokens_details": { "cached_tokens": 4864 } }}cached_tokens는 캐시에 히트된 입력 부분으로, 이 부분은 캐시 배율로 과금됩니다(일반 입력 가격보다 훨씬 저렴),
나머지 입력은 표준 가격으로 과금됩니다. 각 모델의 캐시 배율은 콘솔 모델 광장의 가격 태그에서 확인할 수 있습니다.
비용 절감 실천
- 고객 서비스/Agent 류 애플리케이션에서 도구 정의와 규칙 문서를 모두 앞에 배치하면, 긴 대화의 비용을 크게 줄일 수 있습니다;
- 배치 작업에서 동일한 문서 묶음에 질문할 때, 문서별로 그룹화하여 연속으로 요청을 보내면 히트율이 높아집니다;
- 콘솔 “로그”에서 각 호출의 실제 차감 금액을 확인하여 캐시 적용 여부를 검증합니다.