メインコンテンツまでスキップ

サーバーの監視

監視機能は AI Infrastructure – Metal Cloud サービスに標準で含まれます。

メトリクス、ログ、イベントを収集して可視化することで、潜在的な問題を特定し、今後のワークロードを最適化できます。要件に合った可観測性ソリューションを選択できます。

メトリクスCluster(同一 VPC)単一サーバー
ノード総数とダウン中のノード数
GPU モデル、Driver および CUDA バージョン
電源状態
Uptime
GPU 総数とダウン中の GPU 数
GPU 使用率
GPU メモリ
CPU 使用率
システムメモリ
Root Storage の使用量
ローカルディスクの使用量
GPU ごとの詳細: 消費電力、温度、使用率、VRAM
ネットワーク帯域幅(送信/受信)
ネットワークパケット(送信/受信)
ネットワークエラー率(Rx/Tx)
InfiniBand の帯域幅/パケット/エラー
システムファン回転数
システム電圧
共通アラート

カスタムメトリクスや高度なメトリクスは、追加料金がかかる Cloud Monitoring (FMON) サービスで対応できます。