サーバーの監視
監視機能は AI Infrastructure – Metal Cloud サービスに標準で含まれます。
メトリクス、ログ、イベントを収集して可視化することで、潜在的な問題を特定し、今後のワークロードを最適化できます。要件に合った可観測性ソリューションを選択できます。
| メトリクス | Cluster(同一 VPC) | 単一サーバー |
|---|---|---|
| ノード総数とダウン中のノード数 | ✔ | |
| GPU モデル、Driver および CUDA バージョン | ✔ | |
| 電源状態 | ✔ | |
| Uptime | ✔ | |
| GPU 総数とダウン中の GPU 数 | ✔ | ✔ |
| GPU 使用率 | ✔ | ✔ |
| GPU メモリ | ✔ | ✔ |
| CPU 使用率 | ✔ | ✔ |
| システムメモリ | ✔ | ✔ |
| Root Storage の使用量 | ✔ | ✔ |
| ローカルディスクの使用量 | ✔ | ✔ |
| GPU ごとの詳細: 消費電力、温度、使用率、VRAM | ✔ | |
| ネットワーク帯域幅(送信/受信) | ✔ | ✔ |
| ネットワークパケット(送信/受信) | ✔ | ✔ |
| ネットワークエラー率(Rx/Tx) | ✔ | |
| InfiniBand の帯域幅/パケット/エラー | ✔ | |
| システムファン回転数 | ✔ | |
| システム電圧 | ✔ | |
| 共通アラート | ✔ |
カスタムメトリクスや高度なメトリクスは、追加料金がかかる Cloud Monitoring (FMON) サービスで対応できます。