Bỏ qua nội dung
Trang chính Tin tức Bảng điều khiển

Đầu ra của mô hình suy luận

Một số model của 4ALL API cung cấp các biến thể bậc suy luận, chọn mức suy luận thông qua hậu tố tên model, không cần tham số bổ sung:

Hậu tố bậc

Hậu tốÝ nghĩaVí dụ
-lowMức suy luận thấp, nhanh hơn và tiết kiệm hơngpt-5.5-lowgemini-3.1-pro-low
(không có hậu tố)Bậc mặc địnhgpt-5.5
-highMức suy luận cao, ổn định hơn với vấn đề phức tạpgpt-5.5-highgemini-3.5-flash-high
-xhighBậc cao nhất (một số model)gpt-5.5-xhigh
-thinkingChế độ suy nghĩ của Claudeclaude-opus-4-6-thinking

Cách gọi

Hoàn toàn giống như hội thoại thông thường, chỉ thay tên model:

Terminal window
curl https://api.4allapi.com/v1/chat/completions \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.5-high",
"messages": [{"role": "user", "content": "证明根号2是无理数"}]
}'

Phân tích đầu ra

  • Quá trình suy luận của các model kiểu suy nghĩ có thể xuất hiện trong reasoning_content(hoặc trường gia tăng tương ứng trong streaming), phần nội dung chính vẫn nằm ở content; khi hiển thị giao diện nên thu gọn phần suy luận;
  • Bậc suy luận càng cao thì token đầu ra càng nhiều, độ trễ càng lớn và chi phí càng cao——token suy luận được tính phí theo đầu ra;
  • max_tokens cần chừa đủ dung lượng cho quá trình suy nghĩ, nếu đặt quá nhỏ rất dễ chỉ xuất ra phần suy nghĩ rồi bị cắt ngang(finish_reason: length)。

Gợi ý lựa chọn

  • Dùng bậc mặc định cho hỏi đáp hằng ngày; với toán học, gỡ lỗi mã, lập kế hoạch nhiều bước thì nâng lên -high / -thinking;
  • Với pipeline hàng loạt, trước tiên dùng bậc thấp để chạy toàn bộ, sau đó dùng bậc cao xác minh lại các kết quả có độ tin cậy thấp để tối ưu chi phí.