コンテンツにスキップ
メインサイト ニュース コンソール

サービス可用性

高可用アーキテクチャ

  • 複数上流の冗長化: 同一モデルを複数の上流/複数リージョンの計算資源に接続し、単一障害点の変動を自動で切り替えます;
  • ヘルスチェック: 各上流のレイテンシと成功率を継続的に監視し、異常な経路は自動で切り離し、復旧後に自動で戻します;
  • 自動再試行: 上流の瞬間的なエラーはゲートウェイ内で先に再試行し、揺らぎをできるだけ呼び出し元に見せません。

障害発生中の挙動

  • 個別モデルの上流に大規模障害が発生した場合、そのモデルではレイテンシの増加や 5xx の増加が起こる可能性があります。 他のモデルには影響しません——重要な業務では代替モデルを設定することを推奨します;
  • ゲートウェイ全体のメンテナンスは、事前にコンソールの告知欄でお知らせします。

推奨クライアント設定

項目推奨値
接続タイムアウト5–10s
読み取りタイムアウト(非ストリーミング)60–120s
読み取りタイムアウト(ストリーミング/推論モデル)≥300s
再試行429/5xx に対して指数バックオフで 3–5 回

継続的な異常が発生した場合は、発生時間帯と error.message を添えてサポートまでご連絡ください。