Dedicated Inference
Dedicated Inference とは
Dedicated Inference は、オープンソースの AI モデルを workspace 専用の GPU endpoint にデプロイできるマネージドサービスです。各 endpoint は専有で動作するため、キューの共有や他ユーザーの負荷による影響はありません。
仕組み
Model Catalog からモデルを選び、サイズを指定してデプロイします。FPT AI Factory が GPU を確保し、model weights をダウンロードして vLLM inference server を起動します。endpoint のステータスが Running になったら、API key を使って標準の chat completions API から呼び出せます。
Dedicated Inference を選ぶ理由
- 専用 GPU endpoint — モデルは専有 GPU 上で動作し、低レイテンシを安定して維持できます。
- モデルを完全に制御 — 任意の Hugging Face モデル、デプロイサイズ、Scale to zero の設定を選べます。
- 標準の chat completions API — 任意の HTTP client や Python の
requestsライブラリで利用でき、専用 SDK は不要です。 - キャパシティ課金 — 確保した GPU-hours に対して課金され、token 単位では課金されません。token 使用量(TOKENS IN / TOKENS OUT)は分析用にのみ記録されます。
- 標準搭載の observability — token 使用量とコストを Usage & Billing タブで確認できます。
