Перейти к содержимому
Основной сайт Новости Консоль

Визуальное понимание

Модели с поддержкой зрения (например, gpt-5.6, fable-5, omni-flash) могут напрямую понимать изображения в диалоге: задайте content как мультимодальный массив, смешивая text и image_url.

Пример запроса

Окно терминала
curl https://api.4allapi.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-d '{
"model": "omni-flash",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Какова сумма и дата выставления этого счета?"},
{"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}}
]
}]
}'

Изображения также можно встраивать с помощью base64 Data URL (подходит для изображений во внутренней сети):

{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}

Типичные сценарии

  • Извлечение структурированной информации из чеков / таблиц / скриншотов (в сочетании с response_format для принудительного вывода JSON);
  • Разметка изображений товаров для e-commerce и проверка соответствия;
  • Преобразование UI-скриншотов в код, интерпретация данных диаграмм;
  • Сравнение нескольких изображений: последовательно добавляйте несколько image_url в массив content.

Примечания

  • Изображения тарифицируются по токенам с учетом разрешения; для слишком больших изображений рекомендуется сначала уменьшить их до 2048px или меньше;
  • При использовании URL изображение должно быть доступно из публичного интернета; для внутренних / временных изображений используйте base64;
  • Для понимания видеоконтента используйте модель, поддерживающую видео-ввод, и ориентируйтесь на описание её модели.