コンテンツにスキップ
メインサイト ニュース コンソール

推論モデル出力

4ALL API の一部のモデルでは推論段階のバリアントが提供されており、モデル名のサフィックスで推論強度を選択できます。追加パラメータは不要です:

段階サフィックス

サフィックス意味
-low低い推論強度、より速く、より低コストgpt-5.5-lowgemini-3.1-pro-low
(サフィックスなし)デフォルト段階gpt-5.5
-high高い推論強度、複雑な問題でより安定gpt-5.5-highgemini-3.5-flash-high
-xhigh最高段階(一部モデル)gpt-5.5-xhigh
-thinkingClaude の思考モードclaude-opus-4-6-thinking

呼び出し方法

通常の会話とまったく同じで、モデル名だけを変更します:

Terminal window
curl https://api.4allapi.com/v1/chat/completions \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.5-high",
"messages": [{"role": "user", "content": "证明根号2是无理数"}]
}'

出力の解析

  • 思考系モデルの推論過程は reasoning_content(またはストリーミング増分の同名フィールド)に表示される場合があります。 本文は引き続き content に入ります。UI では推論過程を折りたたんで表示することを推奨します;
  • 推論段階が高いほど、出力 token は増え、遅延も大きくなり、料金も高くなります——推論 token は出力として課金されます;
  • max_tokens には思考過程の分の余裕を確保する必要があります。小さく設定しすぎると、思考の出力だけで切られてしまいやすくなります(finish_reason: length)。

選定のおすすめ

  • 日常的な質問応答はデフォルト段階を使用し、数学、コードデバッグ、多段階の計画では -high / -thinking を使います;
  • バッチ処理のパイプラインでは、まず低い段階で全件を処理し、信頼度の低い結果を高い段階で再確認すると、コストを最適化できます。