Tarification du cache
GPT、Claude、Gemini 系列支持提示词缓存(Prompt Caching):重复的长前缀(如系统提示词、 长文档)命中缓存后,该部分输入按缓存倍率折扣计费,延迟也明显下降。
Comment faire correspondre le cache
- Placez le contenu fixe au tout début du message (prompt système, document de référence), et mettez à la fin les entrées utilisateur qui changent ;
- Il suffit d’appeler plusieurs fois le même préfixe sur une courte période pour obtenir une correspondance, sans paramètre supplémentaire ;
- Le préfixe a un seuil de longueur minimale (généralement environ 1K token) ; s’il est trop court, aucun cache ne sera créé.
Comment confirmer la correspondance
Champ de cache dans usage de la réponse :
{ "usage": { "prompt_tokens": 5210, "completion_tokens": 84, "prompt_tokens_details": { "cached_tokens": 4864 } }}cached_tokens désigne la partie de l’entrée qui a correspondu au cache ; cette partie est facturée selon le multiplicateur de cache (bien inférieur au prix normal d’entrée),
et le reste de l’entrée est facturé au tarif standard. Voir le multiplicateur de cache de chaque modèle dans l’étiquette de prix de la place de modèles du console.
Bonnes pratiques pour économiser
- Pour les applications de type service client/Agent, placez à l’avance toutes les définitions d’outils et les documents de règles ; le coût des longues conversations peut diminuer de façon significative ;
- Pour les tâches par lots lorsque vous interrogez le même ensemble de documents, envoyez les requêtes de façon continue par groupe de documents afin d’augmenter le taux de correspondance ;
- Vérifiez dans le « journal » de la console les frais réels de chaque appel pour confirmer que le cache fonctionne.