Chuyển tới nội dung chính

Deploy một model

Mở modal Deploy

Mở modal Deploy Dedicated Endpoint theo một trong hai cách:

  • Từ Model Catalog — duyệt catalog, tìm model rồi nhấn Deploy trên thẻ của model đó.
  • Từ My endpoints — nhấn Deploy new ở góc trên bên phải.

Modal Deploy Dedicated Endpoint

Điền form

Hugging Face repo / URL

Nhập đường dẫn repository Hugging Face (ví dụ meta-llama/Llama-3.3-70B-Instruct).

Nếu model ở chế độ private hoặc gated, nhập HF token (hf_...) vào ô bên dưới.

ghi chú

Định dạng hỗ trợ: safetensors, transformers, GGUF. Model gated bắt buộc phải có HF token.

Template

Chọn serving runtime ở dropdown Template. Hiện chỉ có một template khả dụng là vllm-openai — vLLM server tương thích OpenAI, phù hợp cho hầu hết LLM.

Bạn có thể nhập thêm các flag vLLM nâng cao ở Custom config để ghi đè mặc định của template (ví dụ --max-model-len 8192). Để trống nếu muốn dùng mặc định.

Region

Chọn region triển khai:

Tùy chọnVị trí
Vietnam — Hanoi (VN-HN)Hà Nội, Việt Nam
Japan — TokyoTokyo, Nhật Bản

Chế độ triển khai

Chuyển đổi giữa QuickAdvanced:

Chế độ Quick — chọn một size dựng sẵn:

SizePhần cứngReplicaĐồng thờiThroughputGiá
Small1× A10-24GB1~5 người dùng~40 token/s$1.2/h
Medium2× H100-80GB1 · autoscale ON~100 người dùng~600 token/s$4.8/h
Large4× H100-80GB2 · autoscale ON~500 người dùng~2.400 token/s$9.6/h

Chế độ Advanced — cấu hình phần cứng trực tiếp:

TrườngMô tả
GPU typeChọn loại GPU và số lượng
Number of replicasHiện cố định ở 1 replica
QuantizationĐịnh dạng độ chính xác (mặc định: FP16)
Auto-shutdown idleTự động dừng endpoint sau khoảng thời gian nhàn rỗi đã chọn

Deploy Dedicated Endpoint — chế độ Advanced

Chi phí ước tính

Ô ESTIMATED COST cập nhật theo size hoặc GPU type bạn chọn:

Trường hợpÝ nghĩa
PER HOURChi phí GPU cơ bản mỗi giờ
BIZ HOURS (8H × 22D)Chi phí tháng ước tính nếu chạy thứ Hai–thứ Sáu, 8 giờ/ngày
24/7Chi phí tháng ước tính nếu chạy liên tục

Deploy

Nhấn Deploy endpoint. Endpoint được tạo và xuất hiện trong My endpoints với trạng thái Deploying. Chờ đến khi trạng thái chuyển sang Running.

Trạng thái endpointÝ nghĩa
DeployingĐang cấp phát GPU và tải model
RunningToàn bộ replica đã sẵn sàng và đang phục vụ request
StoppedĐã scale về 0 — không có GPU nào hoạt động
ghi chú

GPU type và model không đổi được trên endpoint đã tạo. Muốn dùng cấu hình khác, hãy xóa endpoint và tạo mới.

Xem hướng dẫn chi tiết: Quản lý endpoint

Tab My endpoints hiển thị trạng thái endpoint sau khi deploy