思考模式(Thinking)
Claude 思考模式让模型先进行内部推理再作答,复杂推理任务(数学、代码调试、多步规划) 的正确率明显更高,代价是更多输出 token 与延迟。
两种开启方式
方式一:模型名后缀(推荐,任何协议可用)
直接用 -thinking 档位型号,无需其它参数:
claude-opus-4-6-thinkingclaude-sonnet-4-6-thinking
方式二:原生 thinking 参数(Claude 原生接口)
{ "model": "claude-sonnet-5", "max_tokens": 16000, "thinking": { "type": "enabled", "budget_tokens": 8000 }, "messages": [{ "role": "user", "content": "证明:任意 6 人中必有 3 人互相认识或互相不认识" }]}budget_tokens 是思考过程的 token 预算,必须小于 max_tokens。
输出解析
响应 content 中思考与正文分块出现:
{ "content": [ { "type": "thinking", "thinking": "先把问题转化为图染色……" }, { "type": "text", "text": "这是经典的拉姆齐数问题……" } ]}- 界面展示时把
thinking块折叠或隐藏,只把text块当作回答; - 思考 token 按输出计费,预算给太大会显著增加成本;
- 流式模式下思考以
thinking_delta增量下发,见流式与非流式响应。
选型建议
- 常规任务用普通档;判卷、审计、难题攻坚再上思考档;
- 与 GPT/Gemini 的推理档位对比见推理模型输出。