Giám sát server
Tính năng giám sát đi kèm sẵn trong dịch vụ AI Infrastructure – Metal Cloud.
Việc thu thập và trực quan hóa metric, log và event giúp bạn phát hiện sớm vấn đề và tối ưu workload về sau. Bạn chọn được giải pháp observability phù hợp nhu cầu.
| Metric | Cluster (cùng VPC) | Server đơn lẻ |
|---|---|---|
| Tổng số node và số node down | ✔ | |
| Model GPU, phiên bản Driver và CUDA | ✔ | |
| Trạng thái nguồn | ✔ | |
| Uptime | ✔ | |
| Tổng số GPU và số GPU down | ✔ | ✔ |
| Mức sử dụng GPU | ✔ | ✔ |
| Bộ nhớ GPU | ✔ | ✔ |
| Mức sử dụng CPU | ✔ | ✔ |
| Bộ nhớ hệ thống | ✔ | ✔ |
| Mức dùng Root Storage | ✔ | ✔ |
| Mức dùng Local Disk | ✔ | ✔ |
| Chi tiết từng GPU: điện năng tiêu thụ, nhiệt độ, mức sử dụng, VRAM | ✔ | |
| Băng thông mạng vào/ra | ✔ | ✔ |
| Số packet mạng gửi/nhận | ✔ | ✔ |
| Tỷ lệ lỗi mạng Rx/Tx | ✔ | |
| Băng thông/Packet/Lỗi InfiniBand | ✔ | |
| Tốc độ quạt hệ thống | ✔ | |
| Điện áp hệ thống | ✔ | |
| Cảnh báo chung | ✔ |
Metric tùy chỉnh hoặc nâng cao xử lý được qua dịch vụ Cloud Monitoring (FMON), có tính phí riêng.