Доступность сервиса
Высокодоступная архитектура
- Избыточность нескольких upstream: один и тот же модельный доступ подключается к нескольким upstream/мульти-региональным вычислительным ресурсам; при колебаниях в одной точке автоматически выполняется переключение;
- Проверка состояния: непрерывно отслеживаются задержка и успешность каждого upstream; аномальные каналы автоматически исключаются, а после восстановления автоматически возвращаются;
- Автоматические повторы: мгновенные ошибки upstream сначала повторяются внутри шлюза, чтобы по возможности не показывать колебания вызывающей стороне.
Поведение во время сбоев
- При массовом сбое upstream у отдельных моделей у этой модели может наблюдаться рост задержки или увеличение 5xx, на другие модели это не влияет — рекомендуется настроить резервные модели для критически важных сценариев;
- Плановое обслуживание всего шлюза заранее публикуется в объявлении на панели управления.
Рекомендуемая конфигурация клиента
| Пункт | Рекомендуемое значение |
|---|---|
| Таймаут соединения | 5–10s |
| Таймаут чтения (непотоковый) | 60–120s |
| Таймаут чтения (потоковый/модель рассуждений) | ≥300s |
| Повторы | экспоненциальная задержка 3–5 раз для 429/5xx |
При устойчивых аномалиях, пожалуйста, свяжитесь со службой поддержки, указав временной диапазон ошибки и error.message.