Aller au contenu
Site principal Actualités Console

API de compréhension vidéo

La série Gemini prend en charge l’entrée vidéo et peut être utilisée pour le résumé de contenu, la reconnaissance de scènes, l’extraction de sous-titres, les questions-réponses à partir d’un instant précis, etc. La compréhension vidéo est implémentée via l’entrée multimodale de l’appel natif Gemini.

Mode d’appel

L’interface native generateContent transmet la vidéo comme inline_data (petit fichier en base64) :

Fenêtre de terminal
curl "https://api.4allapi.com/v1beta/models/gemini-3.5-flash:generateContent" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [
{"inline_data": {"mime_type": "video/mp4", "data": "<base64 données vidéo>"}},
{"text": "Résumez le contenu principal de cette vidéo et énumérez les points clés dans le temps"}
]
}]
}'

Capacités et cas d’usage

  • Résumé de contenu : compresser une longue vidéo en une liste de points clés ;
  • Reconnaissance de scènes / objets : « Quels produits apparaissent dans la vidéo ? » ;
  • Questions-réponses sur la chronologie : « À quelle seconde les informations de prix commencent-elles à apparaître ? » ;
  • Vérification de conformité : contrôler par lots si les ressources contiennent des éléments interdits.

Points à retenir

  • Les vidéos sont converties en tokens par images + audio, la consommation d’entrée est bien plus élevée que pour le texte ; pour les longues vidéos, commencez par les couper ou n’extrayez que les passages clés ;
  • L’encodage base64 en ligne convient aux courts extraits (recommandé ≤20MB) ; pour les vidéos plus longues, il est conseillé de les découper d’abord ;
  • Il est recommandé de commencer avec gemini-3.5-flash, et d’utiliser gemini-3.1-pro pour les analyses complexes ;
  • Pour les cas d’usage de compréhension d’image (image unique), utilisez Compréhension d’image (reconnaissance d’image) pour économiser davantage.