Mode de réflexion (Thinking)
Le mode de réflexion de Claude permet au modèle d’effectuer d’abord un raisonnement interne avant de répondre ; pour les tâches de raisonnement complexes (mathématiques, débogage de code, planification en plusieurs étapes), le taux de réussite est nettement plus élevé, au prix d’un plus grand nombre de tokens de sortie et d’une latence accrue.
Deux façons de l’activer
Méthode 1 : suffixe au nom du modèle (recommandé, utilisable avec n’importe quel protocole)
Utilisez directement les modèles du niveau -thinking, sans autre paramètre :
claude-opus-4-6-thinkingclaude-sonnet-4-6-thinking
Méthode 2 : paramètre natif thinking (interface native Claude)
{ "model": "claude-sonnet-5", "max_tokens": 16000, "thinking": { "type": "enabled", "budget_tokens": 8000 }, "messages": [{ "role": "user", "content": "证明:任意 6 人中必有 3 人互相认识或互相不认识" }]}budget_tokens est le budget en tokens du processus de réflexion ; il doit être inférieur à max_tokens.
Analyse de la sortie
Dans le content de la réponse, la réflexion et le texte principal apparaissent sous forme de blocs séparés :
{ "content": [ { "type": "thinking", "thinking": "先把问题转化为图染色……" }, { "type": "text", "text": "这是经典的拉姆齐数问题……" } ]}- Lors de l’affichage dans l’interface, le bloc
thinkingest replié ou masqué, et seul le bloctextest traité comme la réponse ; - Les tokens de réflexion sont facturés comme des tokens de sortie ; un budget trop élevé augmentera sensiblement le coût ;
- En mode flux, la réflexion est transmise progressivement via
thinking_delta; voir Réponses en mode flux et hors flux。
Recommandations de choix
- Pour les tâches courantes, utilisez un niveau standard ; pour la correction, l’audit et les problèmes difficiles, passez au niveau réflexion ;
- Pour une comparaison avec les niveaux de raisonnement de GPT/Gemini, voir Sortie des modèles de raisonnement。