Aller au contenu
Site principal Actualités Console

Facturation du cache Claude

Contrairement au cache automatique de GPT/Gemini, le cache de prompts de l’interface native de Claude est déclaré explicitement : utilisez cache_control pour marquer les blocs de contenu à mettre en cache. Lorsqu’ils sont utilisés, cette partie est facturée au tarif du cache.

Utilisation

Ajoutez cache_control sur le système ou sur les blocs de contenu des messages :

{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"system": [
{
"type": "text",
"text": "<document de règles ou base de connaissances de plusieurs milliers de mots>",
"cache_control": { "type": "ephemeral" }
}
],
"messages": [{ "role": "user", "content": "Réponds selon les règles :……" }]
}

Vérifier le cache

Dans usage de la réponse :

{
"usage": {
"input_tokens": 42,
"cache_creation_input_tokens": 4810,
"cache_read_input_tokens": 0,
"output_tokens": 213
}
}
  • Premier appel : cache_creation_input_tokens est compté pour la création du cache (légèrement au-dessus du tarif standard) ;
  • Appels suivants avec cache : cache_read_input_tokens est facturé au tarif du cache (bien inférieur au tarif standard) ;
  • La durée de vie du cache est de l’ordre de quelques minutes ; des appels continus le prolongent automatiquement.

Recommandations pratiques

  • Placez le point de cache après un contenu long et stable : prompt système, définitions d’outils, documentation de référence ;
  • Le contenu mis en cache doit être strictement identique octet par octet ; n’introduisez pas de champs variables comme des horodatages dans le modèle ;
  • Les appels peu fréquents (avec un intervalle supérieur à la durée de vie du cache) ne produiront pas de cache ; recréer le cache à répétition revient alors plus cher — dans les scénarios peu fréquents, n’ajoutez tout simplement pas cache_control ;
  • Lors de l’appel à Claude via une interface compatible OpenAI, le cache est géré automatiquement par l’amont et aucun paramètre n’est nécessaire ; voir Facturation du cache