사고 모드(Thinking)
Claude 사고 모드는 모델이 먼저 내부 추론을 수행한 후 답변하도록 하여, 복잡한 추론 작업(수학, 코드 디버깅, 다단계 계획)의 정확도를 크게 높입니다. 단, 더 많은 출력 토큰과 지연 시간이 발생합니다.
두 가지 활성화 방법
방법 1: 모델명 접미사 사용(권장, 모든 프로토콜 지원)
-thinking 등급 모델명을 직접 사용하며, 추가 파라미터가 필요 없습니다:
claude-opus-4-6-thinkingclaude-sonnet-4-6-thinking
방법 2: 네이티브 thinking 파라미터(Claude 네이티브 인터페이스)
{ "model": "claude-sonnet-5", "max_tokens": 16000, "thinking": { "type": "enabled", "budget_tokens": 8000 }, "messages": [{ "role": "user", "content": "증명: 임의의 6명 중 반드시 3명이 서로 아는 사이이거나 서로 모르는 사이임을 증명하라" }]}budget_tokens는 사고 과정의 토큰 예산으로, 반드시 max_tokens보다 작아야 합니다.
출력 분석
응답 content에서 사고 블록과 본문 블록이 분리되어 나타납니다:
{ "content": [ { "type": "thinking", "thinking": "먼저 문제를 그래프 색칠 문제로 변환하면……" }, { "type": "text", "text": "이것은 고전적인 램지 수 문제입니다……" } ]}- 화면에 표시할 때는
thinking블록을 접거나 숨기고,text블록만 답변으로 표시합니다; - 사고 토큰은 출력 기준으로 과금되므로, 예산을 너무 크게 설정하면 비용이 크게 증가합니다;
- 스트리밍 모드에서는 사고 내용이
thinking_delta로 증분 전송됩니다. 스트리밍 및 비스트리밍 응답을 참조하세요.
모델 선택 가이드
- 일반 작업에는 일반 등급을 사용하고, 채점·감사·난제 해결에는 사고 등급을 사용하세요;
- GPT/Gemini의 추론 등급과의 비교는 추론 모델 출력을 참조하세요.