Facturation du cache Claude
Contrairement au cache automatique de GPT/Gemini, le cache de prompts de l’interface native de Claude est déclaré explicitement :
utilisez cache_control pour marquer les blocs de contenu à mettre en cache. Lorsqu’ils sont utilisés, cette partie est facturée au tarif du cache.
Utilisation
Ajoutez cache_control sur le système ou sur les blocs de contenu des messages :
{ "model": "claude-sonnet-5", "max_tokens": 1024, "system": [ { "type": "text", "text": "<document de règles ou base de connaissances de plusieurs milliers de mots>", "cache_control": { "type": "ephemeral" } } ], "messages": [{ "role": "user", "content": "Réponds selon les règles :……" }]}Vérifier le cache
Dans usage de la réponse :
{ "usage": { "input_tokens": 42, "cache_creation_input_tokens": 4810, "cache_read_input_tokens": 0, "output_tokens": 213 }}- Premier appel :
cache_creation_input_tokensest compté pour la création du cache (légèrement au-dessus du tarif standard) ; - Appels suivants avec cache :
cache_read_input_tokensest facturé au tarif du cache (bien inférieur au tarif standard) ; - La durée de vie du cache est de l’ordre de quelques minutes ; des appels continus le prolongent automatiquement.
Recommandations pratiques
- Placez le point de cache après un contenu long et stable : prompt système, définitions d’outils, documentation de référence ;
- Le contenu mis en cache doit être strictement identique octet par octet ; n’introduisez pas de champs variables comme des horodatages dans le modèle ;
- Les appels peu fréquents (avec un intervalle supérieur à la durée de vie du cache) ne produiront pas de cache ; recréer le cache à répétition revient alors plus cher —
dans les scénarios peu fréquents, n’ajoutez tout simplement pas
cache_control; - Lors de l’appel à Claude via une interface compatible OpenAI, le cache est géré automatiquement par l’amont et aucun paramètre n’est nécessaire ; voir Facturation du cache。