Bỏ qua nội dung
Trang chính Tin tức Bảng điều khiển

Hiểu thị giác

Các mô hình hỗ trợ thị giác (ví dụ gpt-5.6, fable-5, omni-flash) có thể hiểu trực tiếp hình ảnh trong cuộc trò chuyện: hãy viết content thành một mảng đa phương thức, kết hợp textimage_url.

Ví dụ yêu cầu

Terminal window
curl https://api.4allapi.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-d '{
"model": "omni-flash",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Số tiền và ngày lập hóa đơn của tờ hóa đơn này là bao nhiêu?"},
{"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}}
]
}]
}'

Hình ảnh cũng có thể được nhúng bằng base64 Data URL (phù hợp cho ảnh nội bộ):

{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}

Tình huống điển hình

  • Trích xuất thông tin có cấu trúc từ hóa đơn / bảng biểu / ảnh chụp màn hình (kết hợp response_format để ép đầu ra JSON);
  • Gắn nhãn hình ảnh sản phẩm thương mại điện tử và kiểm tra tuân thủ;
  • Chuyển ảnh chụp UI thành mã, diễn giải dữ liệu biểu đồ;
  • So sánh nhiều hình: lần lượt đặt nhiều image_url trong mảng content.

Lưu ý

  • Hình ảnh được tính phí token theo độ phân giải, với ảnh quá lớn nên nén xuống dưới 2048px trước;
  • Cách dùng URL yêu cầu hình ảnh có thể truy cập công khai trên Internet, ảnh nội bộ/tạm thời vui lòng dùng base64;
  • Phân tích nội dung video hãy sử dụng mô hình hỗ trợ đầu vào video và tham khảo mô tả của model đó.