Cước phí bộ nhớ đệm
GPT, Claude, Gemini hỗ trợ bộ nhớ đệm prompt (Prompt Caching): các tiền tố dài lặp lại (như system prompt, tài liệu dài) khi trúng bộ nhớ đệm thì phần đầu vào đó sẽ được tính phí theo hệ số bộ nhớ đệm với mức giảm giá, đồng thời độ trễ cũng giảm rõ rệt.
Cách trúng bộ nhớ đệm
- Đặt nội dung cố định ở đầu thông điệp (system prompt, tài liệu tham khảo), phần đầu vào thay đổi của người dùng để ở cuối;
- Chỉ cần gọi lặp lại cùng một tiền tố trong thời gian ngắn là có thể trúng, không cần tham số bổ sung nào;
- Tiền tố có ngưỡng độ dài tối thiểu (thường khoảng 1K token), quá ngắn thì sẽ không tạo bộ nhớ đệm.
Cách xác nhận trúng
Trường bộ nhớ đệm trong usage của phản hồi:
{ "usage": { "prompt_tokens": 5210, "completion_tokens": 84, "prompt_tokens_details": { "cached_tokens": 4864 } }}cached_tokens chính là phần đầu vào đã trúng bộ nhớ đệm, phần này được tính phí theo hệ số bộ nhớ đệm (thấp hơn nhiều so với giá đầu vào thông thường),
phần còn lại của đầu vào được tính theo giá tiêu chuẩn. Hệ số bộ nhớ đệm của từng model xem ở nhãn giá trong Model Plaza của bảng điều khiển.
Cách tiết kiệm chi phí
- Ứng dụng kiểu chăm sóc khách hàng/Agent nên đưa toàn bộ định nghĩa công cụ và tài liệu quy tắc lên trước, chi phí cho hội thoại dài có thể giảm đáng kể;
- Khi tác vụ hàng loạt hỏi cùng một nhóm tài liệu, hãy gửi request liên tục theo từng nhóm tài liệu để tăng tỷ lệ trúng;
- Đối chiếu khoản phí thực tế của từng lần gọi trong “Nhật ký” trên bảng điều khiển để xác minh bộ nhớ đệm đã hoạt động.