Перейти к содержимому
Основной сайт Новости Консоль

Кэширование тарификации

Серии GPT, Claude, Gemini поддерживают кэширование подсказок (Prompt Caching): при попадании в кэш повторяющегося длинного префикса (например, системных подсказок, длинных документов) эта часть входа тарифицируется со скидкой по кэш-коэффициенту, а задержка также заметно снижается.

Как попасть в кэш

  • Помещайте неизменяемое содержимое в начало сообщения (system-подсказки, справочные документы), а изменяющийся ввод пользователя — в конец;
  • Повторный вызов с тем же префиксом в короткий промежуток времени позволяет попасть в кэш, без дополнительных параметров;
  • У префикса есть минимальный порог длины (обычно около 1K token), слишком короткий префикс кэш не создаст.

Как подтвердить попадание

Поле кэша в usage ответа:

{
"usage": {
"prompt_tokens": 5210,
"completion_tokens": 84,
"prompt_tokens_details": { "cached_tokens": 4864 }
}
}

cached_tokens — это часть входных данных, попавшая в кэш; эта часть тарифицируется по кэш-коэффициенту (значительно ниже обычной цены входа), а остальной ввод — по стандартной цене. Кэш-коэффициент для каждой модели см. в ценовом теге на модельном рынке в консоли.

Практики экономии

  • В приложениях для поддержки клиентов/Agent заранее размещайте определение инструментов и документы с правилами, это может существенно снизить стоимость длинных сессий;
  • При пакетной обработке запросов к одному набору документов отправляйте запросы последовательно, группируя их по документам, чтобы повысить вероятность попадания в кэш;
  • В консоли в разделе «Логи» сверяйте фактическое списание по каждому вызову, чтобы проверить, что кэширование работает.