Перейти к содержимому
Основной сайт Новости Консоль

API понимания видео

Модели серии Gemini поддерживают ввод видео и позволяют выполнять краткое содержание, распознавание сцен, извлечение субтитров, вопросы по времени и многое другое. Понимание видео реализовано через мультимодальный ввод нативного вызова Gemini.

Способ вызова

Нативный интерфейс generateContent передаёт видео как inline_data (небольшие файлы в base64):

Окно терминала
curl "https://api.4allapi.com/v1beta/models/gemini-3.5-flash:generateContent" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [
{"inline_data": {"mime_type": "video/mp4", "data": "<base64 视频数据>"}},
{"text": "总结这段视频的主要内容,并列出关键时间点"}
]
}]
}'

Возможности и сценарии

  • Краткое содержание: сжатие длинного видео в список ключевых пунктов;
  • Распознавание сцен/объектов: «Какие товары появляются в видео?»;
  • Вопросы по временной шкале: «На какой секунде начинает появляться информация о цене?»;
  • Проверка соответствия: пакетная проверка материалов на наличие запрещённых элементов.

Ключевые моменты использования

  • Видео пересчитывается в токены по кадрам + аудио, затраты на ввод значительно выше, чем у текста; длинные видео сначала обрезайте или извлекайте ключевые фрагменты;
  • Встроенный base64 подходит для коротких фрагментов (рекомендуется ≤20MB); более длинные видео лучше предварительно разбивать;
  • Рекомендуется начинать с gemini-3.5-flash, а для сложного анализа использовать gemini-3.1-pro;
  • Для сценариев понимания изображений (одного кадра) лучше использовать понимание изображений (распознавание), это экономичнее.