Serverless Inference
Serverless Inference とは
Serverless Inference は、ホスト済みの language model をすぐに呼び出せるマネージド AI API サービスです。GPU の割り当ても、endpoint のデプロイも、インフラの構築も不要です。catalog から model を選び、API key を作成すれば、API の呼び出しを開始できます。
仕組み
request は FPT AI Factory が管理する共有 GPU fleet にルーティングされます。API key と model 名を添えて serverless gateway の URL に request を送信すると、gateway がキューイング、GPU のスケジューリング、スケーリングを自動的に処理します。課金は消費した token(input と output)のみが対象で、アイドル時間に対する基本料金はかかりません。
Serverless Inference を選ぶ理由
- すぐに利用できる — endpoint のデプロイを待つ必要がありません。API key を用意すれば、すぐに API を呼び出せます。
- token 単位の課金 — 使った分だけ課金されます。GPU の時間単位の予約は不要で、アイドル時のコストもかかりません。
- 運用が不要 — GPU のプロビジョニング、model のロード、スケーリングはすべてマネージドです。
- 標準の chat completions API — 任意の HTTP client、Python の
requests、OpenAI SDK と互換です。base URL を変更するだけで利用できます。 - 可観測性を標準搭載 — token の使用量とコストを Usage タブで確認できます。
Serverless と Dedicated Inference の比較
| Serverless Inference | Dedicated Inference | |
|---|---|---|
| セットアップ | 不要 — すぐに API を呼び出せます | 専用 endpoint をデプロイ(数分) |
| 課金 | input + output の token 単位 | GPU 時間(compute)+ storage |
| GPU | 共有 fleet | workspace 専有 |
| レイテンシ | 変動あり(共有キュー) | 安定(キューの競合なし) |
| 適した用途 | 低〜中程度の traffic、プロトタイピング、バッチ処理 | レイテンシが重要な本番 workload |
