Перейти к содержимому
Основной сайт Новости Консоль

Выходные данные моделей рассуждения

Некоторые модели 4ALL API предоставляют варианты с разным уровнем рассуждения; силу рассуждения выбирают через суффикс в имени модели, без дополнительных параметров:

Суффиксы уровней

СуффиксЗначениеПример
-lowНизкая сила рассуждения, быстрее и экономнееgpt-5.5-low, gemini-3.1-pro-low
(без суффикса)Уровень по умолчаниюgpt-5.5
-highВысокая сила рассуждения, сложные задачи решаются стабильнееgpt-5.5-high, gemini-3.5-flash-high
-xhighМаксимальный уровень (для некоторых моделей)gpt-5.5-xhigh
-thinkingРежим мышления Claudeclaude-opus-4-6-thinking

Способ вызова

Полностью так же, как и при обычном чате, меняется только имя модели:

Окно терминала
curl https://api.4allapi.com/v1/chat/completions \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5.5-high",
"messages": [{"role": "user", "content": "证明根号2是无理数"}]
}'

Разбор вывода

  • Процесс рассуждения у моделей с мышлением может появляться в reasoning_content (или в одноимённом поле при потоковой передаче), при этом основной текст остаётся в content; в интерфейсе рекомендуется сворачивать процесс рассуждения;
  • Чем выше уровень рассуждения, тем больше output token, выше задержка и дороже стоимость — reasoning token тарифицируются как выходные;
  • max_tokens нужно оставлять с запасом для процесса мышления; если задать слишком мало, можно получить только рассуждение, которое будет обрезано (finish_reason: length).

Рекомендации по выбору

  • Для повседневных вопросов используйте уровень по умолчанию; для математики, отладки кода и многошагового планирования переходите на -high / -thinking;
  • В пакетных конвейерах сначала прогоняйте весь объём на низком уровне, а результаты с низкой уверенностью повторно проверяйте на высоком уровне — это наиболее экономично.