Aller au contenu
Site principal Actualités Console

Compréhension visuelle

Les modèles prenant en charge la vision (comme gpt-5.6, fable-5, omni-flash) peuvent comprendre directement les images dans une conversation : écrivez content sous forme de tableau multimodal, en combinant text et image_url.

Exemple de requête

Fenêtre de terminal
curl https://api.4allapi.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-d '{
"model": "omni-flash",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Quel est le montant et la date d'émission de cette facture ?"},
{"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}}
]
}]
}'

Les images peuvent aussi être intégrées via une base64 Data URL (adapté aux images sur intranet) :

{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}

Scénarios typiques

  • Extraction d’informations structurées à partir de reçus / tableaux / captures d’écran (associée à response_format pour forcer une sortie JSON) ;
  • Étiquetage et contrôle de conformité d’images de produits e-commerce ;
  • Conversion de captures d’écran d’interface en code, interprétation de données de graphiques ;
  • Comparaison de plusieurs images : placez successivement plusieurs image_url dans le tableau content.

Remarques

  • La facturation des images est calculée en tokens selon la résolution ; pour les images très grandes, il est recommandé de les compresser au préalable à moins de 2048 px ;
  • La méthode par URL exige que l’image soit accessible publiquement ; pour les images internes ou temporaires, utilisez base64 ;
  • Pour la compréhension de contenu vidéo, utilisez un modèle prenant en charge l’entrée vidéo et référez-vous à sa documentation de modèle.