跳转到内容
主站 新闻 控制台

服务可用性

高可用架构

  • 多上游冗余:同一模型接入多家上游/多区域算力,单点波动自动切换;
  • 健康检查:持续探测各上游的延迟与成功率,异常通道自动摘除、恢复后自动回归;
  • 自动重试:上游瞬时错误在网关内先行重试,尽量不把抖动暴露给调用方。

故障期间的表现

  • 个别模型上游大面积故障时,该模型可能出现延迟升高或 5xx 增多, 其它模型不受影响——建议关键业务配置备选模型;
  • 网关整体维护会提前在控制台公告栏通知。

建议的客户端配置

建议值
连接超时5–10s
读超时(非流式)60–120s
读超时(流式/推理模型)≥300s
重试429/5xx 指数退避 3–5 次

遇到持续性异常,请携带出错时间段与 error.message 联系客服排查。