Chuyển tới nội dung chính

Giám sát server

Tính năng giám sát đi kèm sẵn trong dịch vụ AI Infrastructure – Metal Cloud.

Việc thu thập và trực quan hóa metric, log và event giúp bạn phát hiện sớm vấn đề và tối ưu workload về sau. Bạn chọn được giải pháp observability phù hợp nhu cầu.

MetricCluster (cùng VPC)Server đơn lẻ
Tổng số node và số node down
Model GPU, phiên bản Driver và CUDA
Trạng thái nguồn
Uptime
Tổng số GPU và số GPU down
Mức sử dụng GPU
Bộ nhớ GPU
Mức sử dụng CPU
Bộ nhớ hệ thống
Mức dùng Root Storage
Mức dùng Local Disk
Chi tiết từng GPU: điện năng tiêu thụ, nhiệt độ, mức sử dụng, VRAM
Băng thông mạng vào/ra
Số packet mạng gửi/nhận
Tỷ lệ lỗi mạng Rx/Tx
Băng thông/Packet/Lỗi InfiniBand
Tốc độ quạt hệ thống
Điện áp hệ thống
Cảnh báo chung

Metric tùy chỉnh hoặc nâng cao xử lý được qua dịch vụ Cloud Monitoring (FMON), có tính phí riêng.