Xử lý dữ liệu phản hồi
Trang này giải thích cách phân tích đúng dữ liệu phản hồi mà 4ALL API trả về, áp dụng cho tất cả các mô hình được gọi qua Chat Completions.
Cấu trúc phản hồi không streaming
{ "id": "chatcmpl-xxx", "object": "chat.completion", "model": "gpt-5.5", "choices": [ { "index": 0, "message": { "role": "assistant", "content": "……" }, "finish_reason": "stop" } ], "usage": { "prompt_tokens": 12, "completion_tokens": 46, "total_tokens": 58 }}Xử lý finish_reason
| Giá trị | Ý nghĩa | Cách xử lý khuyến nghị |
|---|---|---|
stop | Kết thúc bình thường | Dùng trực tiếp |
length | Bị cắt do đạt giới hạn max_tokens | Tăng max_tokens hoặc chia đoạn để tiếp tục viết |
tool_calls | Mô hình yêu cầu gọi hàm | Thực thi hàm rồi trả kết quả về, xem FC 函数调用 |
content_filter | Nội dung bị chặn bởi chính sách an toàn của tầng trên | Điều chỉnh prompt |
Trường usage
usagelà căn cứ để đối soát: tính phí theoprompt_tokens/completion_tokensriêng biệt;- Khối dữ liệu cuối cùng của cuộc gọi streaming cũng mang
usage(xem chi tiết tại 流式输出); - Khi khớp với bộ nhớ đệm prompt,
prompt_tokens_details.cached_tokensđánh dấu phần được lưu trong cache, tính phí theo hệ số cache, xem 缓存计费。