Claude tính phí bộ nhớ đệm
Khác với cơ chế bộ nhớ đệm tự động của GPT/Gemini, bộ nhớ đệm prompt của giao diện gốc Claude là được khai báo rõ ràng:
Dùng cache_control để đánh dấu khối nội dung cần lưu đệm. Khi trúng, phần đó sẽ được tính phí theo mức giá bộ nhớ đệm.
Cách dùng
Thêm cache_control vào system hoặc khối nội dung tin nhắn:
{ "model": "claude-sonnet-5", "max_tokens": 1024, "system": [ { "type": "text", "text": "<几千字的规则文档或知识库>", "cache_control": { "type": "ephemeral" } } ], "messages": [{ "role": "user", "content": "根据规则回答:……" }]}Xác nhận trúng bộ nhớ đệm
Trong usage của phản hồi:
{ "usage": { "input_tokens": 42, "cache_creation_input_tokens": 4810, "cache_read_input_tokens": 0, "output_tokens": 213 }}- Lần gọi đầu tiên:
cache_creation_input_tokensđược tính cho việc tạo bộ nhớ đệm (cao hơn một chút so với giá tiêu chuẩn); - Các lần trúng sau:
cache_read_input_tokensđược tính theo mức giá bộ nhớ đệm (thấp hơn nhiều so với giá tiêu chuẩn); - Thời hạn hiệu lực của bộ nhớ đệm là mức phút, nếu tiếp tục gọi sẽ tự động gia hạn.
Khuyến nghị thực hành
- Đặt điểm cache sau nội dung dài và ổn định: prompt hệ thống, định nghĩa công cụ, tài liệu tham khảo;
- Nội dung được cache phải giống hệt từng byte, trong template đừng trộn các trường dễ thay đổi như timestamp;
- Gọi tần suất thấp (khoảng cách vượt quá thời gian sống của cache) sẽ không trúng, tạo cache lặp lại ngược lại còn tốn hơn —
với tình huống tần suất thấp, trực tiếp không thêm
cache_control; - Khi gọi Claude qua giao diện tương thích OpenAI, bộ nhớ đệm sẽ được upstream xử lý tự động, không cần tham số này, xem tính phí bộ nhớ đệm。