컨텐츠로 건너뛰기
主站 新闻 控制台

시각적 이해

시각을 지원하는 모델(예: gpt-5.6, fable-5, omni-flash)은 대화에서 직접 이미지를 이해할 수 있습니다: content를 멀티모달 배열로 작성하여 textimage_url을 혼합합니다.

요청 예시

Terminal window
curl https://api.4allapi.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-d '{
"model": "omni-flash",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "这张发票的金额和开票日期是多少?"},
{"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}}
]
}]
}'

이미지는 base64 Data URL로 인라인 삽입할 수도 있습니다(내부 네트워크 이미지에 적합):

{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}

대표적인 활용 시나리오

  • 영수증 / 표 / 스크린샷의 구조화된 정보 추출(response_format과 함께 사용하여 JSON 출력 강제);
  • 이커머스 상품 이미지 태깅 및 컴플라이언스 검토;
  • UI 스크린샷을 코드로 변환, 차트 데이터 해석;
  • 여러 이미지 비교: content 배열에 여러 image_url을 순서대로 삽입.

주의 사항

  • 이미지는 해상도에 따라 token으로 환산하여 과금되므로, 매우 큰 이미지는 먼저 2048px 이내로 압축하는 것을 권장합니다;
  • URL 방식은 이미지가 공개 인터넷에서 접근 가능해야 하며, 내부 네트워크/임시 이미지는 base64를 사용하세요;
  • 동영상 콘텐츠 이해는 동영상 입력을 지원하는 모델을 사용하고, 해당 모델의 사양 설명을 참고하세요.