Compréhension visuelle
Les modèles prenant en charge la vision (comme gpt-5.6, fable-5, omni-flash) peuvent comprendre directement les images dans une conversation :
écrivez content sous forme de tableau multimodal, en combinant text et image_url.
Exemple de requête
curl https://api.4allapi.com/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $AIPROXY_KEY" \ -d '{ "model": "omni-flash", "messages": [{ "role": "user", "content": [ {"type": "text", "text": "Quel est le montant et la date d'émission de cette facture ?"}, {"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}} ] }] }'Les images peuvent aussi être intégrées via une base64 Data URL (adapté aux images sur intranet) :
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}Scénarios typiques
- Extraction d’informations structurées à partir de reçus / tableaux / captures d’écran (associée à
response_formatpour forcer une sortie JSON) ; - Étiquetage et contrôle de conformité d’images de produits e-commerce ;
- Conversion de captures d’écran d’interface en code, interprétation de données de graphiques ;
- Comparaison de plusieurs images : placez successivement plusieurs
image_urldans le tableaucontent.
Remarques
- La facturation des images est calculée en tokens selon la résolution ; pour les images très grandes, il est recommandé de les compresser au préalable à moins de 2048 px ;
- La méthode par URL exige que l’image soit accessible publiquement ; pour les images internes ou temporaires, utilisez base64 ;
- Pour la compréhension de contenu vidéo, utilisez un modèle prenant en charge l’entrée vidéo et référez-vous à sa documentation de modèle.