Визуальное понимание
Модели с поддержкой зрения (например, gpt-5.6, fable-5, omni-flash) могут напрямую понимать изображения в диалоге:
задайте content как мультимодальный массив, смешивая text и image_url.
Пример запроса
curl https://api.4allapi.com/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $AIPROXY_KEY" \ -d '{ "model": "omni-flash", "messages": [{ "role": "user", "content": [ {"type": "text", "text": "Какова сумма и дата выставления этого счета?"}, {"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}} ] }] }'Изображения также можно встраивать с помощью base64 Data URL (подходит для изображений во внутренней сети):
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}Типичные сценарии
- Извлечение структурированной информации из чеков / таблиц / скриншотов (в сочетании с
response_formatдля принудительного вывода JSON); - Разметка изображений товаров для e-commerce и проверка соответствия;
- Преобразование UI-скриншотов в код, интерпретация данных диаграмм;
- Сравнение нескольких изображений: последовательно добавляйте несколько
image_urlв массивcontent.
Примечания
- Изображения тарифицируются по токенам с учетом разрешения; для слишком больших изображений рекомендуется сначала уменьшить их до 2048px или меньше;
- При использовании URL изображение должно быть доступно из публичного интернета; для внутренних / временных изображений используйте base64;
- Для понимания видеоконтента используйте модель, поддерживающую видео-ввод, и ориентируйтесь на описание её модели.