视觉理解
支持视觉的模型(如 gpt-5.6、fable-5、omni-flash)可以在对话中直接理解图片:
把 content 写成多模态数组,混合 text 与 image_url。
请求示例
curl https://api.4allapi.com/v1/chat/completions \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $AIPROXY_KEY" \ -d '{ "model": "omni-flash", "messages": [{ "role": "user", "content": [ {"type": "text", "text": "这张发票的金额和开票日期是多少?"}, {"type": "image_url", "image_url": {"url": "https://example.com/invoice.jpg"}} ] }] }'图片也可以用 base64 Data URL 内嵌(适合内网图片):
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,/9j/4AAQ..."}}典型场景
- 票据 / 表格 / 截图的结构化信息抽取(配合
response_format强制 JSON 输出); - 电商商品图打标与合规审查;
- UI 截图转代码、图表数据解读;
- 多张图对比:在
content数组中依次放入多个image_url。
注意事项
- 图片按分辨率折算 token 计费,超大图建议先压缩到 2048px 以内;
- URL 方式要求图片可被公网访问,内网/临时图请用 base64;
- 视频内容理解请使用支持视频输入的模型,并参考其型号说明。