视频理解 API
Gemini 系列支持视频输入,可以做内容摘要、场景识别、字幕提取、按时间点问答等。 视频理解通过 Gemini 原生调用 的多模态输入实现。
调用方式
原生 generateContent 接口,把视频作为 inline_data(小文件 base64)传入:
curl "https://api.4allapi.com/v1beta/models/gemini-3.5-flash:generateContent" \ -H "Authorization: Bearer $AIPROXY_KEY" \ -H "Content-Type: application/json" \ -d '{ "contents": [{ "parts": [ {"inline_data": {"mime_type": "video/mp4", "data": "<base64 视频数据>"}}, {"text": "总结这段视频的主要内容,并列出关键时间点"} ] }] }'能力与场景
- 内容摘要:长视频压缩成要点列表;
- 场景/物体识别:“视频里出现了哪些商品?”;
- 时间轴问答:“第几秒开始出现价格信息?”;
- 合规抽查:批量检查素材是否包含违规元素。
使用要点
- 视频按帧+音频折算 token,输入消耗远大于文本,长视频先裁剪或抽关键片段;
- base64 内联适合短片段(建议 ≤20MB);更长的视频建议先切分;
- 推荐
gemini-3.5-flash起步,复杂分析用gemini-3.1-pro; - 图片理解(单帧)场景用图像理解(识图)更省。