시각적 이해
시각을 지원하는 모델(예: gpt-5.6, fable-5, omni-flash)은 대화에서 직접 이미지를 이해할 수 있습니다:
content를 멀티모달 배열로 작성하여 text와 image_url을 혼합합니다.
요청 예시
curl https://api.4allapi.com/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $AIPROXY_KEY" \ -d '{ "model": "omni-flash", "messages": [{ "role": "user", "content": [ {"type": "text", "text": "这张发票的金额和开票日期是多少?"}, {"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}} ] }] }'이미지는 base64 Data URL로 인라인 삽입할 수도 있습니다(내부 네트워크 이미지에 적합):
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}대표적인 활용 시나리오
- 영수증 / 표 / 스크린샷의 구조화된 정보 추출(
response_format과 함께 사용하여 JSON 출력 강제); - 이커머스 상품 이미지 태깅 및 컴플라이언스 검토;
- UI 스크린샷을 코드로 변환, 차트 데이터 해석;
- 여러 이미지 비교:
content배열에 여러image_url을 순서대로 삽입.
주의 사항
- 이미지는 해상도에 따라 token으로 환산하여 과금되므로, 매우 큰 이미지는 먼저 2048px 이내로 압축하는 것을 권장합니다;
- URL 방식은 이미지가 공개 인터넷에서 접근 가능해야 하며, 내부 네트워크/임시 이미지는 base64를 사용하세요;
- 동영상 콘텐츠 이해는 동영상 입력을 지원하는 모델을 사용하고, 해당 모델의 사양 설명을 참고하세요.