추론 모델 출력
4ALL API 의 일부 모델은 추론 등급 변형을 제공하며, 모델명 접미사를 통해 추론 강도를 선택할 수 있습니다. 추가 파라미터는 필요하지 않습니다:
등급 접미사
| 접미사 | 의미 | 예시 |
|---|---|---|
-low | 낮은 추론 강도, 더 빠르고 경제적 | gpt-5.5-low、gemini-3.1-pro-low |
| (접미사 없음) | 기본 등급 | gpt-5.5 |
-high | 높은 추론 강도, 복잡한 문제에 더 안정적 | gpt-5.5-high、gemini-3.5-flash-high |
-xhigh | 최고 등급 (일부 모델) | gpt-5.5-xhigh |
-thinking | Claude 사고 모드 | claude-opus-4-6-thinking |
호출 방법
일반 대화와 완전히 동일하며, 모델명만 변경하면 됩니다:
curl https://api.4allapi.com/v1/chat/completions \ -H "Authorization: Bearer $AIPROXY_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "gpt-5.5-high", "messages": [{"role": "user", "content": "증명: √2는 무리수이다"}] }'출력 파싱
- 사고형 모델의 추론 과정은
reasoning_content(또는 스트리밍 증분의 동명 필드)에 나타날 수 있으며, 본문은 여전히content에 있습니다. UI 표시 시 추론 과정을 접어서 표시하는 것을 권장합니다; - 추론 등급이 높을수록 출력 토큰이 많아지고, 지연이 커지며, 비용이 높아집니다 — 추론 토큰은 출력으로 과금됩니다;
max_tokens는 사고 과정을 위한 여유를 충분히 확보해야 하며, 너무 작게 설정하면 사고 과정만 출력하다 잘릴 수 있습니다 (finish_reason: length).
모델 선택 가이드
- 일상적인 질의응답에는 기본 등급을 사용하고, 수학·코드 디버깅·다단계 계획 수립 시에는
-high/-thinking을 사용하세요; - 대량 파이프라인에서는 먼저 낮은 등급으로 전체를 처리하고, 낮은 신뢰도 결과에 대해 높은 등급으로 재검토하면 비용을 최적화할 수 있습니다.