Tagged articles

dcgm

2 articles · Page 1 of 1
Raymond Ops
Raymond Ops
Jul 2, 2026 · Operations

How to Monitor Large Model Applications: A Beginner‑Friendly Metric System

This guide walks you through building a production‑grade monitoring solution for large language model inference services using a three‑layer metric hierarchy, Prometheus, Grafana, DCGM Exporter, and custom Python metrics, with step‑by‑step deployment, alerting policies, and real‑world troubleshooting examples.

AI infrastructureGrafanaLarge Language Models
0 likes · 42 min read
How to Monitor Large Model Applications: A Beginner‑Friendly Metric System
Linux Kernel Journey
Linux Kernel Journey
Dec 22, 2024 · Artificial Intelligence

Understanding GPU Monitoring: Utilization Metrics and Failure Scenarios

This article systematically reviews GPU monitoring for large‑scale AI training, covering MFU/HFU definitions, key DCGM metrics, NVLink bandwidth, common failure codes such as Xid and SXid, experimental insights on T4 and H100 GPUs, and practical case studies for diagnosing and mitigating performance drops.

GPU failuresGPU monitoringHFU
0 likes · 26 min read
Understanding GPU Monitoring: Utilization Metrics and Failure Scenarios