Chế độ suy nghĩ(Thinking)
Chế độ suy nghĩ của Claude cho phép mô hình thực hiện suy luận nội bộ trước khi trả lời; với các tác vụ suy luận phức tạp (toán học, gỡ lỗi mã, lập kế hoạch nhiều bước), độ chính xác được cải thiện rõ rệt, đổi lại là nhiều token đầu ra hơn và độ trễ cao hơn.
Hai cách bật
Cách 1: Hậu tố tên mô hình (khuyến nghị, dùng được với mọi giao thức)
Trực tiếp dùng mẫu -thinking, không cần tham số khác:
claude-opus-4-6-thinkingclaude-sonnet-4-6-thinking
Cách 2: Tham số thinking gốc (giao diện gốc của Claude)
{ "model": "claude-sonnet-5", "max_tokens": 16000, "thinking": { "type": "enabled", "budget_tokens": 8000 }, "messages": [{ "role": "user", "content": "Chứng minh: trong bất kỳ 6 người nào cũng tồn tại 3 người đôi một quen nhau hoặc đôi một không quen nhau" }]}budget_tokens là ngân sách token cho quá trình suy nghĩ, và phải nhỏ hơn max_tokens.
Phân tích đầu ra
Trong content của phản hồi, phần suy nghĩ và phần nội dung xuất hiện theo từng khối:
{ "content": [ { "type": "thinking", "thinking": "Trước tiên chuyển bài toán thành tô màu đồ thị……" }, { "type": "text", "text": "Đây là bài toán số Ramsey kinh điển……" } ]}- Khi hiển thị trên giao diện, khối
thinkingsẽ được thu gọn hoặc ẩn đi, chỉ coi khốitextlà câu trả lời; - Token suy nghĩ được tính phí theo đầu ra; nếu đặt ngân sách quá lớn sẽ làm chi phí tăng đáng kể;
- Ở chế độ streaming, suy nghĩ được đẩy xuống theo từng phần qua
thinking_delta, xemPhản hồi streaming và không streaming。
Khuyến nghị lựa chọn
- Với tác vụ thông thường, dùng mức bình thường; khi chấm bài, kiểm toán, hoặc giải các bài khó thì hãy dùng mức suy nghĩ;
- So sánh với các mức suy luận của GPT/Gemini xem tạiXuất đầu ra mô hình suy luận。