跳转到内容
主站 新闻 控制台

推理模型输出

4ALL API 的部分型号提供推理档位变体,通过模型名后缀选择推理力度,无需额外参数:

档位后缀

后缀含义示例
-low低推理力度,更快更省gpt-5.5-lowgemini-3.1-pro-low
(无后缀)默认档gpt-5.5
-high高推理力度,复杂问题更稳gpt-5.5-highgemini-3.5-flash-high
-xhigh最高档(部分型号)gpt-5.5-xhigh
-thinkingClaude 思考模式claude-opus-4-6-thinking

调用方式

与普通对话完全一致,只换模型名:

Terminal window
curl https://api.4allapi.com/v1/chat/completions \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.5-high",
"messages": [{"role": "user", "content": "证明根号2是无理数"}]
}'

输出解析

  • 思考类模型的推理过程可能出现在 reasoning_content(或流式增量的同名字段), 正文仍在 content;界面展示建议把推理过程折叠;
  • 推理档位越高,输出 token 越多、延迟越大、费用越高——推理 token 按输出计费;
  • max_tokens 需要给思考过程留出余量,设得过小容易只输出了思考就被截断(finish_reason: length)。

选型建议

  • 日常问答用默认档;数学、代码调试、多步规划再上 -high / -thinking;
  • 批量流水线先用低档跑全量,对低置信结果二次用高档复核,成本最优。