비디오 이해 API
Gemini 시리즈는 비디오 입력을 지원하며, 콘텐츠 요약, 장면 인식, 자막 추출, 시간대별 질의응답 등을 수행할 수 있습니다. 비디오 이해는 Gemini 네이티브 호출의 멀티모달 입력을 통해 구현됩니다.
호출 방식
네이티브 generateContent 인터페이스를 사용하여 비디오를 inline_data(소용량 파일 base64)로 전달합니다:
curl "https://api.4allapi.com/v1beta/models/gemini-3.5-flash:generateContent" \ -H "Authorization: Bearer $AIPROXY_KEY" \ -H "Content-Type: application/json" \ -d '{ "contents": [{ "parts": [ {"inline_data": {"mime_type": "video/mp4", "data": "<base64 视频数据>"}}, {"text": "总结这段视频的主要内容,并列出关键时间点"} ] }] }'기능 및 활용 시나리오
- 콘텐츠 요약: 긴 비디오를 핵심 요점 목록으로 압축;
- 장면/객체 인식: “비디오에 어떤 상품이 등장했나요?”;
- 타임라인 질의응답: “가격 정보가 몇 초부터 나타나나요?”;
- 컴플라이언스 점검: 소재에 위반 요소가 포함되어 있는지 일괄 검사.
사용 시 주의사항
- 비디오는 프레임 + 오디오 기준으로 토큰이 산정되므로, 입력 소비량이 텍스트보다 훨씬 많습니다. 긴 비디오는 먼저 편집하거나 핵심 구간만 추출하세요;
- base64 인라인 방식은 짧은 클립에 적합합니다(권장 ≤20MB). 더 긴 비디오는 먼저 분할하는 것을 권장합니다;
- 시작 모델로
gemini-3.5-flash를 권장하며, 복잡한 분석에는gemini-3.1-pro를 사용하세요; - 단일 프레임 이미지 이해 시나리오에는 이미지 이해(비전)가 더 효율적입니다.