Đầu ra của mô hình suy luận
Một số model của 4ALL API cung cấp các biến thể bậc suy luận, chọn mức suy luận thông qua hậu tố tên model, không cần tham số bổ sung:
Hậu tố bậc
| Hậu tố | Ý nghĩa | Ví dụ |
|---|---|---|
-low | Mức suy luận thấp, nhanh hơn và tiết kiệm hơn | gpt-5.5-low、gemini-3.1-pro-low |
| (không có hậu tố) | Bậc mặc định | gpt-5.5 |
-high | Mức suy luận cao, ổn định hơn với vấn đề phức tạp | gpt-5.5-high、gemini-3.5-flash-high |
-xhigh | Bậc cao nhất (một số model) | gpt-5.5-xhigh |
-thinking | Chế độ suy nghĩ của Claude | claude-opus-4-6-thinking |
Cách gọi
Hoàn toàn giống như hội thoại thông thường, chỉ thay tên model:
curl https://api.4allapi.com/v1/chat/completions \ -H "Authorization: Bearer $AIPROXY_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "gpt-5.5-high", "messages": [{"role": "user", "content": "证明根号2是无理数"}] }'Phân tích đầu ra
- Quá trình suy luận của các model kiểu suy nghĩ có thể xuất hiện trong
reasoning_content(hoặc trường gia tăng tương ứng trong streaming), phần nội dung chính vẫn nằm ởcontent; khi hiển thị giao diện nên thu gọn phần suy luận; - Bậc suy luận càng cao thì token đầu ra càng nhiều, độ trễ càng lớn và chi phí càng cao——token suy luận được tính phí theo đầu ra;
max_tokenscần chừa đủ dung lượng cho quá trình suy nghĩ, nếu đặt quá nhỏ rất dễ chỉ xuất ra phần suy nghĩ rồi bị cắt ngang(finish_reason: length)。
Gợi ý lựa chọn
- Dùng bậc mặc định cho hỏi đáp hằng ngày; với toán học, gỡ lỗi mã, lập kế hoạch nhiều bước thì nâng lên
-high/-thinking; - Với pipeline hàng loạt, trước tiên dùng bậc thấp để chạy toàn bộ, sau đó dùng bậc cao xác minh lại các kết quả có độ tin cậy thấp để tối ưu chi phí.