缓存计费
GPT、Claude、Gemini 系列支持提示词缓存(Prompt Caching):重复的长前缀(如系统提示词、 长文档)命中缓存后,该部分输入按缓存倍率折扣计费,延迟也明显下降。
如何命中缓存
- 把固定不变的内容放在消息最前面(system 提示词、参考文档),变化的用户输入放最后;
- 短时间内重复调用同一前缀即可命中,无需任何额外参数;
- 前缀有最短长度门槛(通常约 1K token),太短不会建缓存。
如何确认命中
响应 usage 中的缓存字段:
{ "usage": { "prompt_tokens": 5210, "completion_tokens": 84, "prompt_tokens_details": { "cached_tokens": 4864 } }}cached_tokens 即命中缓存的输入部分,这部分按缓存倍率计费(远低于正常输入价),
其余输入按标准价。各模型的缓存倍率见控制台模型广场的价格标签。
省钱实践
- 客服/Agent 类应用把工具定义与规则文档全部前置,长会话成本可显著下降;
- 批量任务对同一批文档提问时,按文档分组连续发请求,提高命中率;
- 在控制台”日志”里核对每笔调用的实际扣费,验证缓存生效。