Deploy một model
Mở modal Deploy
Mở modal Deploy Dedicated Endpoint theo một trong hai cách:
- Từ Model Catalog — duyệt catalog, tìm model rồi nhấn Deploy trên thẻ của model đó.
- Từ My endpoints — nhấn Deploy new ở góc trên bên phải.

Điền form
Hugging Face repo / URL
Nhập đường dẫn repository Hugging Face (ví dụ meta-llama/Llama-3.3-70B-Instruct).
Nếu model ở chế độ private hoặc gated, nhập HF token (hf_...) vào ô bên dưới.
Định dạng hỗ trợ: safetensors, transformers, GGUF. Model gated bắt buộc phải có HF token.
Template
Chọn serving runtime ở dropdown Template. Hiện chỉ có một template khả dụng là vllm-openai — vLLM server tương thích OpenAI, phù hợp cho hầu hết LLM.
Bạn có thể nhập thêm các flag vLLM nâng cao ở Custom config để ghi đè mặc định của template (ví dụ --max-model-len 8192). Để trống nếu muốn dùng mặc định.
Region
Chọn region triển khai:
| Tùy chọn | Vị trí |
|---|---|
| Vietnam — Hanoi (VN-HN) | Hà Nội, Việt Nam |
| Japan — Tokyo | Tokyo, Nhật Bản |
Chế độ triển khai
Chuyển đổi giữa Quick và Advanced:
Chế độ Quick — chọn một size dựng sẵn:
| Size | Phần cứng | Replica | Đồng thời | Throughput | Giá |
|---|---|---|---|---|---|
| Small | 1× A10-24GB | 1 | ~5 người dùng | ~40 token/s | $1.2/h |
| Medium | 2× H100-80GB | 1 · autoscale ON | ~100 người dùng | ~600 token/s | $4.8/h |
| Large | 4× H100-80GB | 2 · autoscale ON | ~500 người dùng | ~2.400 token/s | $9.6/h |
Chế độ Advanced — cấu hình phần cứng trực tiếp:
| Trường | Mô tả |
|---|---|
| GPU type | Chọn loại GPU và số lượng |
| Number of replicas | Hiện cố định ở 1 replica |
| Quantization | Định dạng độ chính xác (mặc định: FP16) |
| Auto-shutdown idle | Tự động dừng endpoint sau khoảng thời gian nhàn rỗi đã chọn |

Chi phí ước tính
Ô ESTIMATED COST cập nhật theo size hoặc GPU type bạn chọn:
| Trường hợp | Ý nghĩa |
|---|---|
| PER HOUR | Chi phí GPU cơ bản mỗi giờ |
| BIZ HOURS (8H × 22D) | Chi phí tháng ước tính nếu chạy thứ Hai–thứ Sáu, 8 giờ/ngày |
| 24/7 | Chi phí tháng ước tính nếu chạy liên tục |
Deploy
Nhấn Deploy endpoint. Endpoint được tạo và xuất hiện trong My endpoints với trạng thái Deploying. Chờ đến khi trạng thái chuyển sang Running.
| Trạng thái endpoint | Ý nghĩa |
|---|---|
| Deploying | Đang cấp phát GPU và tải model |
| Running | Toàn bộ replica đã sẵn sàng và đang phục vụ request |
| Stopped | Đã scale về 0 — không có GPU nào hoạt động |
GPU type và model không đổi được trên endpoint đã tạo. Muốn dùng cấu hình khác, hãy xóa endpoint và tạo mới.
Xem hướng dẫn chi tiết: Quản lý endpoint
