Serverless Inference
Serverless Inference là gì?
Serverless Inference là dịch vụ AI API được quản lý, cho phép gọi các language model đã host sẵn ngay lập tức — không cần cấp phát GPU, không cần deploy endpoint, không cần dựng hạ tầng. Chọn model trong catalog, tạo API key, rồi gọi API.
Dịch vụ hoạt động thế nào?
FPT AI Factory định tuyến request tới một GPU fleet dùng chung. Bạn gửi request tới URL của serverless gateway kèm API key và tên model; gateway tự lo hàng đợi, điều phối GPU và scaling. Bạn chỉ trả tiền cho số token đã dùng — cả input lẫn output — không mất phí khi không chạy.
Vì sao chọn Serverless Inference?
- Dùng được ngay — không phải chờ deploy endpoint. Có API key là gọi API được.
- Tính tiền theo token — dùng bao nhiêu trả bấy nhiêu. Không đặt trước GPU theo giờ, không tốn phí khi rảnh.
- Không phải vận hành — cấp phát GPU, nạp model và scaling đều do hệ thống lo.
- Chuẩn chat completions API — tương thích với mọi HTTP client, Python
requestshay OpenAI SDK; chỉ cần đổi base URL. - Theo dõi sẵn — lượng token và chi phí hiển thị ở tab Usage.
Serverless so với Dedicated Inference
| Serverless Inference | Dedicated Inference | |
|---|---|---|
| Thiết lập | Không cần — gọi API ngay | Deploy endpoint riêng (vài phút) |
| Tính phí | Theo token input + output | Theo GPU-giờ (compute) + storage |
| GPU | Fleet dùng chung | Dành riêng cho workspace của bạn |
| Độ trễ | Thay đổi (hàng đợi dùng chung) | Ổn định (không tranh hàng đợi) |
| Phù hợp cho | Traffic thấp đến trung bình, làm prototype, batch job | Workload production nhạy với độ trễ |
