跳转到内容
主站 新闻 控制台

视觉理解

支持视觉的模型(如 gpt-5.6fable-5omni-flash)可以在对话中直接理解图片: 把 content 写成多模态数组,混合 textimage_url

请求示例

Terminal window
curl https://api.4allapi.com/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-d '{
"model": "omni-flash",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "这张发票的金额和开票日期是多少?"},
{"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}}
]
}]
}'

图片也可以用 base64 Data URL 内嵌(适合内网图片):

{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}

典型场景

  • 票据 / 表格 / 截图的结构化信息抽取(配合 response_format 强制 JSON 输出);
  • 电商商品图打标与合规审查;
  • UI 截图转代码、图表数据解读;
  • 多张图对比:在 content 数组中依次放入多个 image_url

注意事项

  • 图片按分辨率折算 token 计费,超大图建议先压缩到 2048px 以内;
  • URL 方式要求图片可被公网访问,内网/临时图请用 base64;
  • 视频内容理解请使用支持视频输入的模型,并参考其型号说明。