Кэширование тарификации
Серии GPT, Claude, Gemini поддерживают кэширование подсказок (Prompt Caching): при попадании в кэш повторяющегося длинного префикса (например, системных подсказок, длинных документов) эта часть входа тарифицируется со скидкой по кэш-коэффициенту, а задержка также заметно снижается.
Как попасть в кэш
- Помещайте неизменяемое содержимое в начало сообщения (system-подсказки, справочные документы), а изменяющийся ввод пользователя — в конец;
- Повторный вызов с тем же префиксом в короткий промежуток времени позволяет попасть в кэш, без дополнительных параметров;
- У префикса есть минимальный порог длины (обычно около 1K token), слишком короткий префикс кэш не создаст.
Как подтвердить попадание
Поле кэша в usage ответа:
{ "usage": { "prompt_tokens": 5210, "completion_tokens": 84, "prompt_tokens_details": { "cached_tokens": 4864 } }}cached_tokens — это часть входных данных, попавшая в кэш; эта часть тарифицируется по кэш-коэффициенту (значительно ниже обычной цены входа),
а остальной ввод — по стандартной цене. Кэш-коэффициент для каждой модели см. в ценовом теге на модельном рынке в консоли.
Практики экономии
- В приложениях для поддержки клиентов/Agent заранее размещайте определение инструментов и документы с правилами, это может существенно снизить стоимость длинных сессий;
- При пакетной обработке запросов к одному набору документов отправляйте запросы последовательно, группируя их по документам, чтобы повысить вероятность попадания в кэш;
- В консоли в разделе «Логи» сверяйте фактическое списание по каждому вызову, чтобы проверить, что кэширование работает.