推理模型输出
4ALL API 的部分型号提供推理档位变体,通过模型名后缀选择推理力度,无需额外参数:
档位后缀
| 后缀 | 含义 | 示例 |
|---|---|---|
-low | 低推理力度,更快更省 | gpt-5.5-low、gemini-3.1-pro-low |
| (无后缀) | 默认档 | gpt-5.5 |
-high | 高推理力度,复杂问题更稳 | gpt-5.5-high、gemini-3.5-flash-high |
-xhigh | 最高档(部分型号) | gpt-5.5-xhigh |
-thinking | Claude 思考模式 | claude-opus-4-6-thinking |
调用方式
与普通对话完全一致,只换模型名:
curl https://api.4allapi.com/v1/chat/completions \ -H "Authorization: Bearer $AIPROXY_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "gpt-5.5-high", "messages": [{"role": "user", "content": "证明根号2是无理数"}] }'输出解析
- 思考类模型的推理过程可能出现在
reasoning_content(或流式增量的同名字段), 正文仍在content;界面展示建议把推理过程折叠; - 推理档位越高,输出 token 越多、延迟越大、费用越高——推理 token 按输出计费;
max_tokens需要给思考过程留出余量,设得过小容易只输出了思考就被截断(finish_reason: length)。
选型建议
- 日常问答用默认档;数学、代码调试、多步规划再上
-high/-thinking; - 批量流水线先用低档跑全量,对低置信结果二次用高档复核,成本最优。