サービス可用性
高可用アーキテクチャ
- 複数上流の冗長化: 同一モデルを複数の上流/複数リージョンの計算資源に接続し、単一障害点の変動を自動で切り替えます;
- ヘルスチェック: 各上流のレイテンシと成功率を継続的に監視し、異常な経路は自動で切り離し、復旧後に自動で戻します;
- 自動再試行: 上流の瞬間的なエラーはゲートウェイ内で先に再試行し、揺らぎをできるだけ呼び出し元に見せません。
障害発生中の挙動
- 個別モデルの上流に大規模障害が発生した場合、そのモデルではレイテンシの増加や 5xx の増加が起こる可能性があります。 他のモデルには影響しません——重要な業務では代替モデルを設定することを推奨します;
- ゲートウェイ全体のメンテナンスは、事前にコンソールの告知欄でお知らせします。
推奨クライアント設定
| 項目 | 推奨値 |
|---|---|
| 接続タイムアウト | 5–10s |
| 読み取りタイムアウト(非ストリーミング) | 60–120s |
| 読み取りタイムアウト(ストリーミング/推論モデル) | ≥300s |
| 再試行 | 429/5xx に対して指数バックオフで 3–5 回 |
継続的な異常が発生した場合は、発生時間帯と error.message を添えてサポートまでご連絡ください。