Bỏ qua nội dung
Trang chính Tin tức Bảng điều khiển

Nhúng văn bản

POST https://api.4allapi.com/v1/embeddings

Chuyển văn bản thành vector chiều cao, dùng cho tìm kiếm ngữ nghĩa, phân cụm, gợi ý và cơ sở tri thức RAG.

Ví dụ yêu cầu

Terminal window
curl https://api.4allapi.com/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $AIPROXY_KEY" \
-d '{
"model": "text-embedding-3-large",
"input": ["4ALL API là gì", "Làm thế nào để tạo API token"]
}'

input hỗ trợ một chuỗi đơn lẻ hoặc mảng chuỗi (gửi hàng loạt); trong phản hồi, mỗi đầu vào tương ứng với một vector embedding:

{
"object": "list",
"data": [
{ "object": "embedding", "index": 0, "embedding": [0.0123, -0.0456, ...] },
{ "object": "embedding", "index": 1, "embedding": [...] }
],
"model": "text-embedding-3-large",
"usage": { "prompt_tokens": 14, "total_tokens": 14 }
}

Gợi ý thực hành

  • Toàn bộ cùng một cơ sở tri thức nên dùng cùng một mô hình nhúng, không thể trộn lẫn không gian vector của các mô hình khác nhau;
  • Với tài liệu dài, hãy chia thành từng đoạn nhỏ trước (ví dụ 300–800 ký tự, có chồng lấn) rồi mới nhúng, tỷ lệ truy xuất trúng cao hơn;
  • Khi nhúng hàng loạt, gửi nhiều mục cùng lúc dưới dạng mảng, nhanh hơn và tiết kiệm hơn so với gửi từng mục một;
  • Nhúng được tính phí theo token đầu vào, giá thấp hơn nhiều so với mô hình hội thoại, phù hợp cho lập chỉ mục quy mô lớn.