컨텐츠로 건너뛰기
主站 新闻 控制台

사고 모드(Thinking)

Claude 사고 모드는 모델이 먼저 내부 추론을 수행한 후 답변하도록 하여, 복잡한 추론 작업(수학, 코드 디버깅, 다단계 계획)의 정확도를 크게 높입니다. 단, 더 많은 출력 토큰과 지연 시간이 발생합니다.

두 가지 활성화 방법

방법 1: 모델명 접미사 사용(권장, 모든 프로토콜 지원)

-thinking 등급 모델명을 직접 사용하며, 추가 파라미터가 필요 없습니다:

  • claude-opus-4-6-thinking
  • claude-sonnet-4-6-thinking

방법 2: 네이티브 thinking 파라미터(Claude 네이티브 인터페이스)

{
"model": "claude-sonnet-5",
"max_tokens": 16000,
"thinking": { "type": "enabled", "budget_tokens": 8000 },
"messages": [{ "role": "user", "content": "증명: 임의의 6명 중 반드시 3명이 서로 아는 사이이거나 서로 모르는 사이임을 증명하라" }]
}

budget_tokens는 사고 과정의 토큰 예산으로, 반드시 max_tokens보다 작아야 합니다.

출력 분석

응답 content에서 사고 블록과 본문 블록이 분리되어 나타납니다:

{
"content": [
{ "type": "thinking", "thinking": "먼저 문제를 그래프 색칠 문제로 변환하면……" },
{ "type": "text", "text": "이것은 고전적인 램지 수 문제입니다……" }
]
}
  • 화면에 표시할 때는 thinking 블록을 접거나 숨기고, text 블록만 답변으로 표시합니다;
  • 사고 토큰은 출력 기준으로 과금되므로, 예산을 너무 크게 설정하면 비용이 크게 증가합니다;
  • 스트리밍 모드에서는 사고 내용이 thinking_delta로 증분 전송됩니다. 스트리밍 및 비스트리밍 응답을 참조하세요.

모델 선택 가이드

  • 일반 작업에는 일반 등급을 사용하고, 채점·감사·난제 해결에는 사고 등급을 사용하세요;
  • GPT/Gemini의 추론 등급과의 비교는 추론 모델 출력을 참조하세요.