컨텐츠로 건너뛰기
主站 新闻 控制台

추론 모델 출력

4ALL API 의 일부 모델은 추론 등급 변형을 제공하며, 모델명 접미사를 통해 추론 강도를 선택할 수 있습니다. 추가 파라미터는 필요하지 않습니다:

등급 접미사

접미사의미예시
-low낮은 추론 강도, 더 빠르고 경제적gpt-5.5-lowgemini-3.1-pro-low
(접미사 없음)기본 등급gpt-5.5
-high높은 추론 강도, 복잡한 문제에 더 안정적gpt-5.5-highgemini-3.5-flash-high
-xhigh최고 등급 (일부 모델)gpt-5.5-xhigh
-thinkingClaude 사고 모드claude-opus-4-6-thinking

호출 방법

일반 대화와 완전히 동일하며, 모델명만 변경하면 됩니다:

Terminal window
curl https://api.4allapi.com/v1/chat/completions \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.5-high",
"messages": [{"role": "user", "content": "증명: √2는 무리수이다"}]
}'

출력 파싱

  • 사고형 모델의 추론 과정은 reasoning_content(또는 스트리밍 증분의 동명 필드)에 나타날 수 있으며, 본문은 여전히 content에 있습니다. UI 표시 시 추론 과정을 접어서 표시하는 것을 권장합니다;
  • 추론 등급이 높을수록 출력 토큰이 많아지고, 지연이 커지며, 비용이 높아집니다 — 추론 토큰은 출력으로 과금됩니다;
  • max_tokens 는 사고 과정을 위한 여유를 충분히 확보해야 하며, 너무 작게 설정하면 사고 과정만 출력하다 잘릴 수 있습니다 (finish_reason: length).

모델 선택 가이드

  • 일상적인 질의응답에는 기본 등급을 사용하고, 수학·코드 디버깅·다단계 계획 수립 시에는 -high / -thinking을 사용하세요;
  • 대량 파이프라인에서는 먼저 낮은 등급으로 전체를 처리하고, 낮은 신뢰도 결과에 대해 높은 등급으로 재검토하면 비용을 최적화할 수 있습니다.