API de compréhension vidéo
La série Gemini prend en charge l’entrée vidéo et peut être utilisée pour le résumé de contenu, la reconnaissance de scènes, l’extraction de sous-titres, les questions-réponses à partir d’un instant précis, etc. La compréhension vidéo est implémentée via l’entrée multimodale de l’appel natif Gemini.
Mode d’appel
L’interface native generateContent transmet la vidéo comme inline_data (petit fichier en base64) :
curl "https://api.4allapi.com/v1beta/models/gemini-3.5-flash:generateContent" \ -H "Authorization: Bearer $AIPROXY_KEY" \ -H "Content-Type: application/json" \ -d '{ "contents": [{ "parts": [ {"inline_data": {"mime_type": "video/mp4", "data": "<base64 données vidéo>"}}, {"text": "Résumez le contenu principal de cette vidéo et énumérez les points clés dans le temps"} ] }] }'Capacités et cas d’usage
- Résumé de contenu : compresser une longue vidéo en une liste de points clés ;
- Reconnaissance de scènes / objets : « Quels produits apparaissent dans la vidéo ? » ;
- Questions-réponses sur la chronologie : « À quelle seconde les informations de prix commencent-elles à apparaître ? » ;
- Vérification de conformité : contrôler par lots si les ressources contiennent des éléments interdits.
Points à retenir
- Les vidéos sont converties en tokens par images + audio, la consommation d’entrée est bien plus élevée que pour le texte ; pour les longues vidéos, commencez par les couper ou n’extrayez que les passages clés ;
- L’encodage base64 en ligne convient aux courts extraits (recommandé ≤20MB) ; pour les vidéos plus longues, il est conseillé de les découper d’abord ;
- Il est recommandé de commencer avec
gemini-3.5-flash, et d’utilisergemini-3.1-propour les analyses complexes ; - Pour les cas d’usage de compréhension d’image (image unique), utilisez Compréhension d’image (reconnaissance d’image) pour économiser davantage.