智能客服升级
按问题复杂度自动分配模型,在体验、成本与稳定性之间取得平衡。
4ALL API 的模型切换只需改 model 字段,分层路由在业务侧几行代码就能实现。
分层路由策略
| 层级 | 场景 | 推荐模型 |
|---|---|---|
| L1 快答 | 问候、FAQ、订单查询 | gpt-5.4-mini、gemini-3.5-flash |
| L2 标准 | 多轮咨询、售后处理 | gpt-5.5、claude-haiku-4-5 |
| L3 疑难 | 投诉、复杂政策解释 | claude-sonnet-5、gpt-5.5-high |
def pick_model(question, history): if is_faq(question): return "gpt-5.4-mini" if needs_escalation(question, history): return "claude-sonnet-5" return "gpt-5.5"落地要点
- 全系模型走同一个 Chat Completions 接口,切换零改造,见 Chat Completions;
- 用流式输出降低首字延迟,客服体验差异明显;
- 为客服系统单独建一个令牌并设额度上限,便于成本核算与止损,见 认证与密钥;
- 上游偶发抖动时按 错误码与重试 做降级(如 L3 降到 L2 模型兜底)。