Bỏ qua nội dung
Trang chính Tin tức Bảng điều khiển

API hiểu video

Dòng Gemini hỗ trợ đầu vào video, có thể dùng để tóm tắt nội dung, nhận diện cảnh, trích xuất phụ đề, hỏi đáp theo mốc thời gian, v.v. Khả năng hiểu video được thực hiện thông qua đầu vào đa phương thức của lời gọi nguyên bản Gemini.

Cách gọi

Giao diện generateContent nguyên bản, truyền video dưới dạng inline_data(tệp nhỏ base64):

Terminal window
curl "https://api.4allapi.com/v1beta/models/gemini-3.5-flash:generateContent" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [
{"inline_data": {"mime_type": "video/mp4", "data": "<base64 dữ liệu video>"}},
{"text": "Tóm tắt nội dung chính của đoạn video này, và liệt kê các mốc thời gian quan trọng"}
]
}]
}'

Năng lực và kịch bản

  • Tóm tắt nội dung: nén video dài thành danh sách các ý chính;
  • Nhận diện cảnh/đối tượng: “Trong video xuất hiện những sản phẩm nào?”;
  • Hỏi đáp theo dòng thời gian: “Từ giây thứ mấy bắt đầu xuất hiện thông tin giá?”;
  • Kiểm tra tuân thủ: kiểm tra hàng loạt xem tài liệu có chứa yếu tố vi phạm hay không.

Lưu ý khi sử dụng

  • Video được quy đổi token theo khung hình + âm thanh, mức tiêu thụ đầu vào lớn hơn nhiều so với văn bản, với video dài hãy cắt trước hoặc trích các đoạn quan trọng;
  • Base64 nội tuyến phù hợp cho đoạn ngắn (khuyến nghị ≤20MB); với video lớn hơn nên chia nhỏ trước;
  • Khuyến nghị bắt đầu với gemini-3.5-flash, phân tích phức tạp dùng gemini-3.1-pro;
  • Với kịch bản hiểu ảnh (một khung hình), dùng hiểu hình ảnh (nhận diện ảnh) sẽ tiết kiệm hơn.