API понимания видео
Модели серии Gemini поддерживают ввод видео и позволяют выполнять краткое содержание, распознавание сцен, извлечение субтитров, вопросы по времени и многое другое. Понимание видео реализовано через мультимодальный ввод нативного вызова Gemini.
Способ вызова
Нативный интерфейс generateContent передаёт видео как inline_data (небольшие файлы в base64):
curl "https://api.4allapi.com/v1beta/models/gemini-3.5-flash:generateContent" \ -H "Authorization: Bearer $AIPROXY_KEY" \ -H "Content-Type: application/json" \ -d '{ "contents": [{ "parts": [ {"inline_data": {"mime_type": "video/mp4", "data": "<base64 视频数据>"}}, {"text": "总结这段视频的主要内容,并列出关键时间点"} ] }] }'Возможности и сценарии
- Краткое содержание: сжатие длинного видео в список ключевых пунктов;
- Распознавание сцен/объектов: «Какие товары появляются в видео?»;
- Вопросы по временной шкале: «На какой секунде начинает появляться информация о цене?»;
- Проверка соответствия: пакетная проверка материалов на наличие запрещённых элементов.
Ключевые моменты использования
- Видео пересчитывается в токены по кадрам + аудио, затраты на ввод значительно выше, чем у текста; длинные видео сначала обрезайте или извлекайте ключевые фрагменты;
- Встроенный base64 подходит для коротких фрагментов (рекомендуется ≤20MB); более длинные видео лучше предварительно разбивать;
- Рекомендуется начинать с
gemini-3.5-flash, а для сложного анализа использоватьgemini-3.1-pro; - Для сценариев понимания изображений (одного кадра) лучше использовать понимание изображений (распознавание), это экономичнее.