Claude tính phí bộ nhớ đệm
Khác với cơ chế bộ nhớ đệm tự động của GPT/Gemini, bộ nhớ đệm prompt của giao diện gốc Claude là được khai báo rõ ràng:
Dùng cache_control để đánh dấu khối nội dung cần lưu đệm. Khi trúng, phần đó sẽ được tính phí theo mức giá bộ nhớ đệm.
Cách dùng
Phần tiêu đề “Cách dùng”Thêm cache_control vào system hoặc khối nội dung tin nhắn:
{ "model": "claude-sonnet-5", "max_tokens": 1024, "system": [ { "type": "text", "text": "<几千字的规则文档或知识库>", "cache_control": { "type": "ephemeral" } } ], "messages": [{ "role": "user", "content": "根据规则回答:……" }]}Xác nhận trúng bộ nhớ đệm
Phần tiêu đề “Xác nhận trúng bộ nhớ đệm”Trong usage của phản hồi:
{ "usage": { "input_tokens": 42, "cache_creation_input_tokens": 4810, "cache_read_input_tokens": 0, "output_tokens": 213 }}- Lần gọi đầu tiên:
cache_creation_input_tokensđược tính cho việc tạo bộ nhớ đệm (cao hơn một chút so với giá tiêu chuẩn); - Các lần trúng sau:
cache_read_input_tokensđược tính theo mức giá bộ nhớ đệm (thấp hơn nhiều so với giá tiêu chuẩn); - Thời hạn hiệu lực của bộ nhớ đệm là mức phút, nếu tiếp tục gọi sẽ tự động gia hạn.
Khuyến nghị thực hành
Phần tiêu đề “Khuyến nghị thực hành”- Đặt điểm cache sau nội dung dài và ổn định: prompt hệ thống, định nghĩa công cụ, tài liệu tham khảo;
- Nội dung được cache phải giống hệt từng byte, trong template đừng trộn các trường dễ thay đổi như timestamp;
- Gọi tần suất thấp (khoảng cách vượt quá thời gian sống của cache) sẽ không trúng, tạo cache lặp lại ngược lại còn tốn hơn —
với tình huống tần suất thấp, trực tiếp không thêm
cache_control; - Khi gọi Claude qua giao diện tương thích OpenAI, bộ nhớ đệm sẽ được upstream xử lý tự động, không cần tham số này, xem tính phí bộ nhớ đệm。