Режим мышления (Thinking)
Режим мышления Claude позволяет модели сначала выполнить внутреннее рассуждение, а затем ответить; для задач сложного рассуждения (математика, отладка кода, многошаговое планирование) точность заметно выше, но ценой большего числа выходных токенов и задержки.
Два способа включения
Способ 1: суффикс в имени модели (рекомендуется, подходит для любого протокола)
Просто используйте модель уровня -thinking, без дополнительных параметров:
claude-opus-4-6-thinkingclaude-sonnet-4-6-thinking
Способ 2: нативный параметр thinking (нативный интерфейс Claude)
{ "model": "claude-sonnet-5", "max_tokens": 16000, "thinking": { "type": "enabled", "budget_tokens": 8000 }, "messages": [{ "role": "user", "content": "Доказать: среди любых 6 человек обязательно найдутся 3, которые все знакомы друг с другом, или 3, которые все не знакомы друг с другом" }]}budget_tokens — это бюджет токенов для процесса мышления; он должен быть меньше max_tokens.
Разбор вывода
В ответе content мыслительная часть и основная часть появляются отдельными блоками:
{ "content": [ { "type": "thinking", "thinking": "Сначала преобразуем задачу в раскраску графа……" }, { "type": "text", "text": "Это классическая задача Рамсея……" } ]}- При отображении интерфейс сворачивает или скрывает блок
thinking, а блокtextрассматривает как ответ; - Токены мышления учитываются при тарификации как выходные токены; слишком большой бюджет заметно увеличит стоимость;
- В режиме потоковой передачи мышление отправляется инкрементально через
thinking_delta; см. Потоковые и непотоковые ответы.
Рекомендации по выбору
- Для обычных задач используйте обычный уровень; для проверки, аудита и решения сложных задач — уровень мышления;
- Сравнение с уровнями рассуждения GPT/Gemini см. в Вывод моделей рассуждения.