Aller au contenu
Site principal Actualités Console

Support client intelligent amélioré

Répartir automatiquement les modèles en fonction de la complexité des questions, afin d’équilibrer expérience, coût et stabilité. La bascule de modèle dans 4ALL API ne nécessite qu’une modification du champ model; le routage par niveaux peut être réalisé côté métier en quelques lignes de code.

Stratégie de routage par niveaux

NiveauScénarioModèle recommandé
L1 Réponses rapidesSalutations, FAQ, consultation de commandesgpt-5.4-mini, gemini-3.5-flash
L2 StandardConsultations multi-tours, traitement après-ventegpt-5.5, claude-haiku-4-5
L3 DifficilePlaintes, explications de politiques complexesclaude-sonnet-5, gpt-5.5-high
def pick_model(question, history):
if is_faq(question):
return "gpt-5.4-mini"
if needs_escalation(question, history):
return "claude-sonnet-5"
return "gpt-5.5"

Points clés de mise en œuvre

  • Tous les modèles de la gamme utilisent la même interface Chat Completions, sans refonte pour le changement, voir Chat Completions;
  • Utiliser la sortie en flux pour réduire la latence du premier token, l’écart d’expérience en service client est nettement visible;
  • Créer un jeton dédié au système de service client et définir un plafond de quota, afin de faciliter le calcul des coûts et la limitation des pertes, voir Authentification et clés;
  • En cas de fluctuations ponctuelles en amont, appliquer un repli selon Codes d’erreur et réessais (par exemple, faire descendre le modèle de L3 vers un modèle L2 en solution de secours).