推論モデル出力
4ALL API の一部のモデルでは推論段階のバリアントが提供されており、モデル名のサフィックスで推論強度を選択できます。追加パラメータは不要です:
段階サフィックス
| サフィックス | 意味 | 例 |
|---|---|---|
-low | 低い推論強度、より速く、より低コスト | gpt-5.5-low、gemini-3.1-pro-low |
| (サフィックスなし) | デフォルト段階 | gpt-5.5 |
-high | 高い推論強度、複雑な問題でより安定 | gpt-5.5-high、gemini-3.5-flash-high |
-xhigh | 最高段階(一部モデル) | gpt-5.5-xhigh |
-thinking | Claude の思考モード | claude-opus-4-6-thinking |
呼び出し方法
通常の会話とまったく同じで、モデル名だけを変更します:
curl https://api.4allapi.com/v1/chat/completions \ -H "Authorization: Bearer $AIPROXY_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "gpt-5.5-high", "messages": [{"role": "user", "content": "证明根号2是无理数"}] }'出力の解析
- 思考系モデルの推論過程は
reasoning_content(またはストリーミング増分の同名フィールド)に表示される場合があります。 本文は引き続きcontentに入ります。UI では推論過程を折りたたんで表示することを推奨します; - 推論段階が高いほど、出力 token は増え、遅延も大きくなり、料金も高くなります——推論 token は出力として課金されます;
max_tokensには思考過程の分の余裕を確保する必要があります。小さく設定しすぎると、思考の出力だけで切られてしまいやすくなります(finish_reason: length)。
選定のおすすめ
- 日常的な質問応答はデフォルト段階を使用し、数学、コードデバッグ、多段階の計画では
-high/-thinkingを使います; - バッチ処理のパイプラインでは、まず低い段階で全件を処理し、信頼度の低い結果を高い段階で再確認すると、コストを最適化できます。