컨텐츠로 건너뛰기
主站 新闻 控制台

비디오 이해 API

Gemini 시리즈는 비디오 입력을 지원하며, 콘텐츠 요약, 장면 인식, 자막 추출, 시간대별 질의응답 등을 수행할 수 있습니다. 비디오 이해는 Gemini 네이티브 호출의 멀티모달 입력을 통해 구현됩니다.

호출 방식

네이티브 generateContent 인터페이스를 사용하여 비디오를 inline_data(소용량 파일 base64)로 전달합니다:

Terminal window
curl "https://api.4allapi.com/v1beta/models/gemini-3.5-flash:generateContent" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [
{"inline_data": {"mime_type": "video/mp4", "data": "<base64 视频数据>"}},
{"text": "总结这段视频的主要内容,并列出关键时间点"}
]
}]
}'

기능 및 활용 시나리오

  • 콘텐츠 요약: 긴 비디오를 핵심 요점 목록으로 압축;
  • 장면/객체 인식: “비디오에 어떤 상품이 등장했나요?”;
  • 타임라인 질의응답: “가격 정보가 몇 초부터 나타나나요?”;
  • 컴플라이언스 점검: 소재에 위반 요소가 포함되어 있는지 일괄 검사.

사용 시 주의사항

  • 비디오는 프레임 + 오디오 기준으로 토큰이 산정되므로, 입력 소비량이 텍스트보다 훨씬 많습니다. 긴 비디오는 먼저 편집하거나 핵심 구간만 추출하세요;
  • base64 인라인 방식은 짧은 클립에 적합합니다(권장 ≤20MB). 더 긴 비디오는 먼저 분할하는 것을 권장합니다;
  • 시작 모델로 gemini-3.5-flash를 권장하며, 복잡한 분석에는 gemini-3.1-pro를 사용하세요;
  • 단일 프레임 이미지 이해 시나리오에는 이미지 이해(비전)가 더 효율적입니다.