Hiểu thị giác
Các mô hình hỗ trợ thị giác (ví dụ gpt-5.6, fable-5, omni-flash) có thể hiểu trực tiếp hình ảnh trong cuộc trò chuyện:
hãy viết content thành một mảng đa phương thức, kết hợp text và image_url.
Ví dụ yêu cầu
curl https://api.4allapi.com/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $AIPROXY_KEY" \ -d '{ "model": "omni-flash", "messages": [{ "role": "user", "content": [ {"type": "text", "text": "Số tiền và ngày lập hóa đơn của tờ hóa đơn này là bao nhiêu?"}, {"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}} ] }] }'Hình ảnh cũng có thể được nhúng bằng base64 Data URL (phù hợp cho ảnh nội bộ):
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}Tình huống điển hình
- Trích xuất thông tin có cấu trúc từ hóa đơn / bảng biểu / ảnh chụp màn hình (kết hợp
response_formatđể ép đầu ra JSON); - Gắn nhãn hình ảnh sản phẩm thương mại điện tử và kiểm tra tuân thủ;
- Chuyển ảnh chụp UI thành mã, diễn giải dữ liệu biểu đồ;
- So sánh nhiều hình: lần lượt đặt nhiều
image_urltrong mảngcontent.
Lưu ý
- Hình ảnh được tính phí token theo độ phân giải, với ảnh quá lớn nên nén xuống dưới 2048px trước;
- Cách dùng URL yêu cầu hình ảnh có thể truy cập công khai trên Internet, ảnh nội bộ/tạm thời vui lòng dùng base64;
- Phân tích nội dung video hãy sử dụng mô hình hỗ trợ đầu vào video và tham khảo mô tả của model đó.