跳转到内容
主站 新闻 控制台

缓存计费

GPT、Claude、Gemini 系列支持提示词缓存(Prompt Caching):重复的长前缀(如系统提示词、 长文档)命中缓存后,该部分输入按缓存倍率折扣计费,延迟也明显下降。

如何命中缓存

  • 固定不变的内容放在消息最前面(system 提示词、参考文档),变化的用户输入放最后;
  • 短时间内重复调用同一前缀即可命中,无需任何额外参数;
  • 前缀有最短长度门槛(通常约 1K token),太短不会建缓存。

如何确认命中

响应 usage 中的缓存字段:

{
"usage": {
"prompt_tokens": 5210,
"completion_tokens": 84,
"prompt_tokens_details": { "cached_tokens": 4864 }
}
}

cached_tokens 即命中缓存的输入部分,这部分按缓存倍率计费(远低于正常输入价), 其余输入按标准价。各模型的缓存倍率见控制台模型广场的价格标签。

省钱实践

  • 客服/Agent 类应用把工具定义与规则文档全部前置,长会话成本可显著下降;
  • 批量任务对同一批文档提问时,按文档分组连续发请求,提高命中率;
  • 在控制台”日志”里核对每笔调用的实际扣费,验证缓存生效。