Chuyển tới nội dung chính

FAQ

Tính phí

1. Dedicated Inference tính phí thế nào?

Chi phí gồm hai thành phần, tính độc lập với nhau:

Thành phầnTính phí khi nào
Compute (GPU)Chỉ khi endpoint ở trạng thái Running
StorageLiên tục cho đến khi endpoint bị xóa

Phí compute tính theo phút, tối thiểu 60 giây và làm tròn lên. Lượng token (TOKENS IN / TOKENS OUT) chỉ ghi nhận để phân tích, không tính phí.

2. Endpoint đang pause (Stopped) có mất phí storage không?

Có. Khi bạn dừng endpoint, phí GPU dừng ngay lập tức nhưng phí storage vẫn tiếp tục. Model weights vẫn nằm trên NVMe disk đã attach trong lúc endpoint ở trạng thái Stopped, nên phần storage vẫn đang được giữ chỗ.

Phí storage chỉ dừng khi bạn xóa endpoint. Vòng đời endpoint là: Creating → Running → Stopped → Deleted.

3. Hết số dư thì chuyện gì xảy ra?

Tùy loại endpoint:

Loại endpointKhi số dư về 0
Hỗ trợ scale-to-zeroCó 30 giây ân hạn để xử lý nốt request đang chạy, sau đó replica giảm về 0
Always-onRequest mới bị từ chối với mã 402, request đang chạy vẫn hoàn tất bình thường

Nạp thêm số dư để khôi phục ngay. Phí storage vẫn phát sinh khi endpoint ở trạng thái Stopped.

cảnh báo

Nếu số dư âm nặng trong thời gian dài, hệ thống có thể hard stop — toàn bộ traffic bị từ chối ngay, kể cả request đang chạy. Khôi phục cần thao tác thủ công và nạp thêm số dư.

4. Có đặt được hạn mức chi tiêu không?

Có. Vào My endpoints → Usage & Billing và nhấn Set budget alert để cấu hình ngưỡng cảnh báo chi tiêu hàng tháng.


Endpoint

5. Endpoint mất bao lâu để khởi động?

Thời gian khởi động phụ thuộc kích thước model. Ví dụ model 7B (như Mistral 7B) thường mất khoảng 3 phút. Model lớn hơn sẽ lâu hơn.

6. Tạo endpoint xong có đổi được GPU type hoặc model không?

Không. GPU type và model không đổi được trên endpoint đã tạo. Muốn dùng GPU hoặc model khác, hãy xóa endpoint và tạo mới.

Các thao tác khả dụng trên endpoint là: start, stop, scale, redeploy, delete. Không có thao tác cập nhật tại chỗ hay đổi cấu hình.

7. Trạng thái Deploying nghĩa là gì?

Endpoint đang được cấp phát. Hệ thống đang cấp GPU và tải model weights. Nhấn tên endpoint để mở trang chi tiết và xem deployment log để theo dõi tiến độ.

8. Một endpoint chạy được nhiều model không?

Không. Mỗi endpoint chỉ phục vụ đúng một model. Muốn chạy song song nhiều model, hãy tạo endpoint riêng cho từng model.


API Key

9. Tạo API key ở đâu?

Vào Dedicated Inference → API keys để tạo và copy key. Xem Tạo và quản lý API key để biết các bước chi tiết.


API và tích hợp

10. Gọi API bằng HTTP client hoặc thư viện Python thông thường được không?

Được. Endpoint cung cấp chat completions API chuẩn. Gateway URL nằm ở trang chi tiết endpoint sau khi endpoint đạt trạng thái Running.

11. Bị lỗi 429 Too Many Requests, rate limit là bao nhiêu?

Rate limit áp dụng trên ba chiều: request mỗi phút (RPM), token mỗi phút (TPM) và số request đồng thời. Khi vượt ngưỡng, gateway trả về 429 rate_limited. Liên hệ support để xin nâng hạn mức.

12. Endpoint có hỗ trợ streaming response không?

Có. Đặt "stream": true trong request body. API trả về Server-Sent Events (SSE). Xem Gọi Inference API để có ví dụ code streaming.