서비스 가용성
고가용성 아키텍처
- 다중 업스트림 이중화: 동일 모델에 여러 업스트림/다중 리전 컴퓨팅 파워를 연결하여, 단일 지점 장애 시 자동으로 전환;
- 헬스 체크: 각 업스트림의 지연 및 성공률을 지속적으로 모니터링하며, 이상 채널은 자동으로 제거하고 복구 후 자동으로 복귀;
- 자동 재시도: 업스트림의 일시적 오류는 게이트웨이 내에서 먼저 재시도하여, 불안정한 상태가 호출자에게 노출되지 않도록 최대한 방지.
장애 발생 시 동작
- 특정 모델의 업스트림에 대규모 장애가 발생하면 해당 모델의 지연이 증가하거나 5xx 오류가 늘어날 수 있으며, 다른 모델에는 영향을 주지 않습니다 — 중요한 비즈니스에는 대체 모델을 설정하는 것을 권장합니다;
- 게이트웨이 전체 점검은 사전에 콘솔 공지란을 통해 안내됩니다.
권장 클라이언트 설정
| 항목 | 권장값 |
|---|---|
| 연결 타임아웃 | 5–10s |
| 읽기 타임아웃 (비스트리밍) | 60–120s |
| 읽기 타임아웃 (스트리밍/추론 모델) | ≥300s |
| 재시도 | 429/5xx 지수 백오프 3–5회 |
지속적인 이상이 발생하면, 오류 발생 시간대와 error.message를 함께 첨부하여 고객 지원팀에 문의해 주세요.