跳转到内容
主站 新闻 控制台

视频理解 API

Gemini 系列支持视频输入,可以做内容摘要、场景识别、字幕提取、按时间点问答等。 视频理解通过 Gemini 原生调用 的多模态输入实现。

调用方式

原生 generateContent 接口,把视频作为 inline_data(小文件 base64)传入:

Terminal window
curl "https://api.4allapi.com/v1beta/models/gemini-3.5-flash:generateContent" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [
{"inline_data": {"mime_type": "video/mp4", "data": "<base64 视频数据>"}},
{"text": "总结这段视频的主要内容,并列出关键时间点"}
]
}]
}'

能力与场景

  • 内容摘要:长视频压缩成要点列表;
  • 场景/物体识别:“视频里出现了哪些商品?”;
  • 时间轴问答:“第几秒开始出现价格信息?”;
  • 合规抽查:批量检查素材是否包含违规元素。

使用要点

  • 视频按帧+音频折算 token,输入消耗远大于文本,长视频先裁剪或抽关键片段;
  • base64 内联适合短片段(建议 ≤20MB);更长的视频建议先切分;
  • 推荐 gemini-3.5-flash 起步,复杂分析用 gemini-3.1-pro;
  • 图片理解(单帧)场景用图像理解(识图)更省。