Chuyển tới nội dung chính

Dedicated Inference

Dedicated Inference là gì?

Dedicated Inference là dịch vụ managed cho phép bạn deploy AI model mã nguồn mở lên các GPU endpoint riêng của workspace. Mỗi endpoint chạy độc quyền cho bạn — không dùng chung hàng đợi, không bị ảnh hưởng bởi tải của người khác.

Hoạt động thế nào?

Chọn model từ Model Catalog, chọn size rồi deploy. FPT AI Factory cấp phát GPU, tải model weights và khởi động vLLM inference server. Khi endpoint chuyển sang Running, bạn gọi endpoint bằng API key qua chat completions API chuẩn.

Vì sao chọn Dedicated Inference?

  1. GPU endpoint riêng — model chạy trên GPU dành riêng cho bạn, cho độ trễ thấp và ổn định.
  2. Toàn quyền kiểm soát model — chọn bất kỳ Hugging Face model, deployment size và thiết lập Scale to zero.
  3. Chat completions API chuẩn — dùng được với mọi HTTP client hoặc thư viện Python requests, không cần SDK riêng.
  4. Tính phí theo capacity — tính theo GPU-hours đã đặt trước, không theo token. Lượng token (TOKENS IN / TOKENS OUT) chỉ ghi nhận để phân tích.
  5. Observability sẵn có — theo dõi lượng token và chi phí ở tab Usage & Billing.

Dedicated Inference — tab Model Catalog với 8 model được tuyển chọn