メインコンテンツまでスキップ

Dedicated Inference

Dedicated Inference とは

Dedicated Inference は、オープンソースの AI モデルを workspace 専用の GPU endpoint にデプロイできるマネージドサービスです。各 endpoint は専有で動作するため、キューの共有や他ユーザーの負荷による影響はありません。

仕組み

Model Catalog からモデルを選び、サイズを指定してデプロイします。FPT AI Factory が GPU を確保し、model weights をダウンロードして vLLM inference server を起動します。endpoint のステータスが Running になったら、API key を使って標準の chat completions API から呼び出せます。

Dedicated Inference を選ぶ理由

  1. 専用 GPU endpoint — モデルは専有 GPU 上で動作し、低レイテンシを安定して維持できます。
  2. モデルを完全に制御 — 任意の Hugging Face モデル、デプロイサイズ、Scale to zero の設定を選べます。
  3. 標準の chat completions API — 任意の HTTP client や Python の requests ライブラリで利用でき、専用 SDK は不要です。
  4. キャパシティ課金 — 確保した GPU-hours に対して課金され、token 単位では課金されません。token 使用量(TOKENS IN / TOKENS OUT)は分析用にのみ記録されます。
  5. 標準搭載の observability — token 使用量とコストを Usage & Billing タブで確認できます。

Dedicated Inference — 8 つの厳選モデルを表示する Model Catalog タブ