Chuyển tới nội dung chính

FAQ

Tính phí

1. Serverless Inference tính phí thế nào?

Bạn trả tiền theo token — token input và token output được đếm riêng và có thể có đơn giá khác nhau. Không có phí cố định, không có phí đặt trước GPU, và không tốn phí khi bạn không gửi request.

Chi phí phản ánh ở tab Usage & Billing và trừ vào Organization Wallet.

2. Đang chạy mà hết số dư thì sao?

Request vượt quá số dư còn lại sẽ bị từ chối với response 402 Payment Required. Request đã bắt đầu trước khi số dư về 0 vẫn chạy xong bình thường. Nạp thêm vào Wallet để gửi request tiếp ngay.

3. Xem giá theo token của từng model ở đâu?

Mỗi thẻ model trong Model Catalog hiển thị giá theo token cho input và output riêng. Bạn cũng có thể xem trang Pricing trong Billing — tìm tab AI Inference → Serverless endpoint.


API & tích hợp

4. API có tương thích với OpenAI SDK không?

Có. Serverless gateway cung cấp endpoint chuẩn /v1/chat/completions. Bạn dùng được OpenAI Python SDK bằng cách đặt base_url trỏ tới URL gateway và api_key là serverless API key của bạn.

from openai import OpenAI

client = OpenAI(
base_url="https://<serverless-gateway-domain>/v1",
api_key="<your-api-key>",
)

response = client.chat.completions.create(
model="<model-name>",
messages=[{"role": "user", "content": "Hello!"}],
)
print(response.choices[0].message.content)

5. API có hỗ trợ streaming không?

Có. Đặt "stream": true trong body của request. Gateway trả về Server-Sent Events (SSE). Xem ví dụ streaming ở Gọi Inference API.

6. Tôi bị 429 Too Many Requests. Rate limit là bao nhiêu?

Rate limit áp theo từng API key, gồm số request mỗi phút (RPM), số token mỗi phút (TPM) và số request đồng thời. Khi vượt giới hạn, gateway trả về 429 rate_limited. Liên hệ support để xin nâng hạn mức.

7. Dùng chung một API key cho cả Serverless và Dedicated Inference được không?

Không. API key gắn với đúng dịch vụ nơi nó được tạo. API key của Serverless Inference chỉ dùng được với serverless gateway, và API key của Dedicated Inference chỉ dùng được với gateway của dedicated endpoint.


Model

8. Có những model nào?

Tab Model Catalog hiển thị toàn bộ model hiện có. Catalog được cập nhật định kỳ — xem tại đó để biết danh sách mới nhất.

9. Dùng model riêng hoặc model tự huấn luyện được không?

Không. Serverless Inference chỉ phục vụ model trong catalog được quản lý. Để deploy model riêng hoặc model Hugging Face tự chọn, dùng Dedicated Inference.

10. Context window hỗ trợ tới bao nhiêu?

Mỗi thẻ model trong catalog hiển thị context window tối đa. Giá trị này khác nhau theo từng model — xem catalog để biết chi tiết.


API key

11. Tạo được bao nhiêu API key?

Không giới hạn số API key trên mỗi workspace. Nên tạo key riêng cho từng ứng dụng hoặc từng môi trường để xoay vòng hoặc thu hồi một key mà không ảnh hưởng key khác.

12. Xem được key nào đã gửi một request cụ thể không?

Có. Tab Usage & Billing hiển thị API key gắn với từng request trong log.