Aller au contenu
Site principal Actualités Console

Disponibilité du service

Architecture haute disponibilité

  • Redondance multi-upstream : le même modèle est connecté à plusieurs upstreams / ressources de calcul multi-régions, avec basculement automatique en cas de fluctuation d’un point unique ;
  • Vérification de santé : détection continue de la latence et du taux de réussite de chaque upstream, suppression automatique des canaux anormaux et retour automatique après rétablissement ;
  • Nouvelle tentative automatique : les erreurs instantanées de l’upstream sont d’abord retentées dans la passerelle afin d’éviter, autant que possible, d’exposer les fluctuations à l’appelant.

Comportement pendant les pannes

  • Lors d’une panne généralisée de l’upstream d’un modèle particulier, ce modèle peut présenter une latence accrue ou une augmentation des 5xx ; les autres modèles ne sont pas affectés — il est recommandé de configurer un modèle de secours pour les services critiques ;
  • La maintenance globale de la passerelle sera annoncée à l’avance dans la bannière d’annonces de la console.

Configuration client recommandée

ÉlémentValeur recommandée
Délai d’attente de connexion5–10s
Délai d’attente de lecture (non flux)60–120s
Délai d’attente de lecture (flux / modèle d’inférence)≥300s
Tentatives3–5 reprises avec backoff exponentiel pour 429/5xx

En cas d’anomalie persistante, veuillez contacter le support avec la période d’erreur et error.message pour enquête.