メインコンテンツまでスキップ

Serverless Inference

Serverless Inference とは

Serverless Inference は、ホスト済みの language model をすぐに呼び出せるマネージド AI API サービスです。GPU の割り当ても、endpoint のデプロイも、インフラの構築も不要です。catalog から model を選び、API key を作成すれば、API の呼び出しを開始できます。

仕組み

request は FPT AI Factory が管理する共有 GPU fleet にルーティングされます。API key と model 名を添えて serverless gateway の URL に request を送信すると、gateway がキューイング、GPU のスケジューリング、スケーリングを自動的に処理します。課金は消費した token(input と output)のみが対象で、アイドル時間に対する基本料金はかかりません。

Serverless Inference を選ぶ理由

  1. すぐに利用できる — endpoint のデプロイを待つ必要がありません。API key を用意すれば、すぐに API を呼び出せます。
  2. token 単位の課金 — 使った分だけ課金されます。GPU の時間単位の予約は不要で、アイドル時のコストもかかりません。
  3. 運用が不要 — GPU のプロビジョニング、model のロード、スケーリングはすべてマネージドです。
  4. 標準の chat completions API — 任意の HTTP client、Python の requests、OpenAI SDK と互換です。base URL を変更するだけで利用できます。
  5. 可観測性を標準搭載 — token の使用量とコストを Usage タブで確認できます。

Serverless と Dedicated Inference の比較

Serverless InferenceDedicated Inference
セットアップ不要 — すぐに API を呼び出せます専用 endpoint をデプロイ(数分)
課金input + output の token 単位GPU 時間(compute)+ storage
GPU共有 fleetworkspace 専有
レイテンシ変動あり(共有キュー)安定(キューの競合なし)
適した用途低〜中程度の traffic、プロトタイピング、バッチ処理レイテンシが重要な本番 workload

Serverless Inference — API Keys