服务可用性
高可用架构
- 多上游冗余:同一模型接入多家上游/多区域算力,单点波动自动切换;
- 健康检查:持续探测各上游的延迟与成功率,异常通道自动摘除、恢复后自动回归;
- 自动重试:上游瞬时错误在网关内先行重试,尽量不把抖动暴露给调用方。
故障期间的表现
- 个别模型上游大面积故障时,该模型可能出现延迟升高或 5xx 增多, 其它模型不受影响——建议关键业务配置备选模型;
- 网关整体维护会提前在控制台公告栏通知。
建议的客户端配置
| 项 | 建议值 |
|---|---|
| 连接超时 | 5–10s |
| 读超时(非流式) | 60–120s |
| 读超时(流式/推理模型) | ≥300s |
| 重试 | 429/5xx 指数退避 3–5 次 |
遇到持续性异常,请携带出错时间段与 error.message 联系客服排查。