Умная поддержка клиентов
Автоматически распределяйте модели по сложности вопроса, достигая баланса между опытом, затратами и стабильностью.
Переключение моделей в 4ALL API сводится к изменению поля model, а многоуровневую маршрутизацию можно реализовать на стороне бизнеса всего несколькими строками кода.
Стратегия многоуровневой маршрутизации
| Уровень | Сценарий | Рекомендуемая модель |
|---|---|---|
| L1 Быстрый ответ | Приветствия, FAQ, запросы по заказу | gpt-5.4-mini、gemini-3.5-flash |
| L2 Стандартный | Многоходовые консультации, обработка послепродажных обращений | gpt-5.5、claude-haiku-4-5 |
| L3 Сложный | Жалобы, сложные объяснения политики | claude-sonnet-5、gpt-5.5-high |
def pick_model(question, history): if is_faq(question): return "gpt-5.4-mini" if needs_escalation(question, history): return "claude-sonnet-5" return "gpt-5.5"Ключевые моменты внедрения
- Все модели работают через один и тот же интерфейс Chat Completions, переключение без доработок; см. Chat Completions;
- Используйте потоковый вывод, чтобы снизить задержку до первого токена; разница в опыте поддержки заметна;
- Создайте отдельный токен для системы поддержки и задайте верхний предел квоты, чтобы упростить расчет затрат и ограничение убытков; см. Аутентификация и ключи;
- При случайных сбоях на стороне upstream используйте коды ошибок и повторные попытки для деградации (например, при L3 откатывайтесь на модель L2).