メインコンテンツまでスキップ

FAQ

課金​

1. Serverless Inference の課金方法は?

token 単位で課金されます。input token と output token は別々にカウントされ、単価が異なる場合があります。基本料金、GPU の予約料金はなく、request を送信していない間のコストもかかりません。

課金内容は Usage & Billing タブに反映され、Organization Wallet から差し引かれます。

2. request の途中で残高がなくなるとどうなりますか?

残高を超える request は 402 Payment Required で拒否されます。残高が 0 になる前に開始した request は、そのまま正常に完了します。Wallet にチャージすれば、すぐに request を再開できます。

3. model ごとの token 単価はどこで確認できますか?

Model Catalog の各 model カードに、input と output の token 単価が個別に表示されます。Billing の Pricing ページでも確認できます。AI Inference → Serverless endpoint タブをご覧ください。


API と連携​

4. API は OpenAI SDK と互換ですか?

はい。serverless gateway は標準の /v1/chat/completions endpoint を提供します。base_url に gateway の URL、api_key に serverless API key を設定すれば、OpenAI Python SDK をそのまま利用できます。

from openai import OpenAI

client = OpenAI(
base_url="https://<serverless-gateway-domain>/v1",
api_key="<your-api-key>",
)

response = client.chat.completions.create(
model="<model-name>",
messages=[{"role": "user", "content": "Hello!"}],
)
print(response.choices[0].message.content)

5. API は streaming に対応していますか?

はい。request body に "stream": true を設定します。gateway は Server-Sent Events(SSE)を返します。streaming の例は Inference API を呼び出す を参照してください。

6. 429 Too Many Requests が返ります。rate limit はどうなっていますか?

rate limit は API key ごとに、1 分あたりの request 数(RPM)、1 分あたりの token 数(TPM)、同時 request 数に適用されます。上限を超えると gateway は 429 rate_limited を返します。上限の引き上げは support にお問い合わせください。

7. 同じ API key を Serverless と Dedicated Inference の両方で使えますか?

いいえ。API key は作成したサービスにひも付きます。Serverless Inference の API key は serverless gateway でのみ、Dedicated Inference の API key は dedicated endpoint の gateway でのみ利用できます。


Model​

8. どの model が利用できますか?

Model Catalog タブに、現在利用できる model がすべて表示されます。catalog は定期的に更新されるため、最新の一覧はそちらで確認してください。

9. プライベート model やカスタム model を使えますか?

いいえ。Serverless Inference はマネージド catalog の model のみを提供します。プライベート model やカスタムの Hugging Face model をデプロイする場合は Dedicated Inference を利用してください。

10. 対応している context window のサイズは?

catalog の各 model カードに最大 context window が表示されます。値は model ごとに異なるため、catalog で確認してください。


API Keys​

11. API key はいくつまで作成できますか?

workspace あたりの API key 数に上限はありません。アプリケーションや環境ごとに key を分けておくと、他に影響を与えずに個別のローテーションや失効ができます。

12. どの key がどの request を送信したか確認できますか?

はい。Usage & Billing タブのログに、各 request にひも付く API key が表示されます。