FAQ
課金
1. Serverless Inference の課金方法は?
token 単位で課金されます。input token と output token は別々にカウントされ、単価が異なる場合があります。基本料金、GPU の予約料金はなく、request を送信していない間のコストもかかりません。
課金内容は Usage & Billing タブに反映され、Organization Wallet から差し引かれます。
2. request の途中で残高がなくなるとどうなりますか?
残高を超える request は 402 Payment Required で拒否されます。残高が 0 になる前に開始した request は、そのまま正常に完了します。Wallet にチャージすれば、すぐに request を再開できます。
3. model ごとの token 単価はどこで確認できますか?
Model Catalog の各 model カードに、input と output の token 単価が個別に表示されます。Billing の Pricing ページでも確認できます。AI Inference → Serverless endpoint タブをご覧ください。
API と連携
4. API は OpenAI SDK と互換ですか?
はい。serverless gateway は標準の /v1/chat/completions endpoint を提供します。base_url に gateway の URL、api_key に serverless API key を設定すれば、OpenAI Python SDK をそのまま利用できます。
from openai import OpenAI
client = OpenAI(
base_url="https://<serverless-gateway-domain>/v1",
api_key="<your-api-key>",
)
response = client.chat.completions.create(
model="<model-name>",
messages=[{"role": "user", "content": "Hello!"}],
)
print(response.choices[0].message.content)
5. API は streaming に対応していますか?
はい。request body に "stream": true を設定します。gateway は Server-Sent Events(SSE)を返します。streaming の例は Inference API を呼び出す を参照してください。
6. 429 Too Many Requests が返ります。rate limit はどうなっていますか?
rate limit は API key ごとに、1 分あたりの request 数(RPM)、1 分あたりの token 数(TPM)、同時 request 数に適用されます。上限を超えると gateway は 429 rate_limited を返します。上限の引き上げは support にお問い合わせください。
7. 同じ API key を Serverless と Dedicated Inference の両方で使えますか?
いいえ。API key は作成したサービスにひも付きます。Serverless Inference の API key は serverless gateway でのみ、Dedicated Inference の API key は dedicated endpoint の gateway でのみ利用できます。
Model
8. どの model が利用できますか?
Model Catalog タブに、現在利用できる model がすべて表示されます。catalog は定期的に更新されるため、最新の一覧はそちらで確認してください。
9. プライベート model やカスタム model を使えますか?
いいえ。Serverless Inference はマネージド catalog の model のみを提供します。プライベート model やカスタムの Hugging Face model をデプロイする場合は Dedicated Inference を利用してください。
10. 対応している context window のサイズは?
catalog の各 model カードに最大 context window が表示されます。値は model ごとに異なるため、catalog で確認してください。
API Keys
11. API key はいくつまで作成できますか?
workspace あたりの API key 数に上限はありません。アプリケーションや環境ごとに key を分けておくと、他に影響を与えずに個別のローテーションや失効ができます。
12. どの key がどの request を送信したか確認できますか?
はい。Usage & Billing タブのログに、各 request にひも付く API key が表示されます。