Disponibilité du service
Architecture haute disponibilité
- Redondance multi-upstream : le même modèle est connecté à plusieurs upstreams / ressources de calcul multi-régions, avec basculement automatique en cas de fluctuation d’un point unique ;
- Vérification de santé : détection continue de la latence et du taux de réussite de chaque upstream, suppression automatique des canaux anormaux et retour automatique après rétablissement ;
- Nouvelle tentative automatique : les erreurs instantanées de l’upstream sont d’abord retentées dans la passerelle afin d’éviter, autant que possible, d’exposer les fluctuations à l’appelant.
Comportement pendant les pannes
- Lors d’une panne généralisée de l’upstream d’un modèle particulier, ce modèle peut présenter une latence accrue ou une augmentation des 5xx ; les autres modèles ne sont pas affectés — il est recommandé de configurer un modèle de secours pour les services critiques ;
- La maintenance globale de la passerelle sera annoncée à l’avance dans la bannière d’annonces de la console.
Configuration client recommandée
| Élément | Valeur recommandée |
|---|---|
| Délai d’attente de connexion | 5–10s |
| Délai d’attente de lecture (non flux) | 60–120s |
| Délai d’attente de lecture (flux / modèle d’inférence) | ≥300s |
| Tentatives | 3–5 reprises avec backoff exponentiel pour 429/5xx |
En cas d’anomalie persistante, veuillez contacter le support avec la période d’erreur et error.message pour enquête.