Bỏ qua nội dung
Trang chính Tin tức Bảng điều khiển

Claude tính phí bộ nhớ đệm

Khác với cơ chế bộ nhớ đệm tự động của GPT/Gemini, bộ nhớ đệm prompt của giao diện gốc Claude là được khai báo rõ ràng: Dùng cache_control để đánh dấu khối nội dung cần lưu đệm. Khi trúng, phần đó sẽ được tính phí theo mức giá bộ nhớ đệm.

Cách dùng

Thêm cache_control vào system hoặc khối nội dung tin nhắn:

{
"model": "claude-sonnet-5",
"max_tokens": 1024,
"system": [
{
"type": "text",
"text": "<几千字的规则文档或知识库>",
"cache_control": { "type": "ephemeral" }
}
],
"messages": [{ "role": "user", "content": "根据规则回答:……" }]
}

Xác nhận trúng bộ nhớ đệm

Trong usage của phản hồi:

{
"usage": {
"input_tokens": 42,
"cache_creation_input_tokens": 4810,
"cache_read_input_tokens": 0,
"output_tokens": 213
}
}
  • Lần gọi đầu tiên: cache_creation_input_tokens được tính cho việc tạo bộ nhớ đệm (cao hơn một chút so với giá tiêu chuẩn);
  • Các lần trúng sau: cache_read_input_tokens được tính theo mức giá bộ nhớ đệm (thấp hơn nhiều so với giá tiêu chuẩn);
  • Thời hạn hiệu lực của bộ nhớ đệm là mức phút, nếu tiếp tục gọi sẽ tự động gia hạn.

Khuyến nghị thực hành

  • Đặt điểm cache sau nội dung dài và ổn định: prompt hệ thống, định nghĩa công cụ, tài liệu tham khảo;
  • Nội dung được cache phải giống hệt từng byte, trong template đừng trộn các trường dễ thay đổi như timestamp;
  • Gọi tần suất thấp (khoảng cách vượt quá thời gian sống của cache) sẽ không trúng, tạo cache lặp lại ngược lại còn tốn hơn — với tình huống tần suất thấp, trực tiếp không thêm cache_control;
  • Khi gọi Claude qua giao diện tương thích OpenAI, bộ nhớ đệm sẽ được upstream xử lý tự động, không cần tham số này, xem tính phí bộ nhớ đệm