GPU-Server im Produktivbetrieb überwachen: DCGM-Metriken, Clock Event Reasons, Speicherfehler und XIDs
- Die GPU-Auslastung zählt die Zeit, in der irgendein Kernel läuft, also ergibt ein Kernel, der ein Fünftel der Multiprozessoren über das ganze Intervall beschäftigt, trotzdem 100 Prozent; DCGMs SM-Aktivität liegt dafür bei 0,2, und NVIDIA bezeichnet 0,8 oder mehr als notwendig, aber nicht hinreichend
- DCGM 4.6 hat seine Felder umbenannt, darunter DCGM_FI_DEV_GPU_UTIL in DCGM_FI_DEV_GPU_UTIL_RATIO, und behält die alten Namen als veraltete Aliasse; die Standarddatei von dcgm-exporter nutzt noch die alten
- dcgm-exporter liefert Prometheus-Metriken auf Port 9400, aber in seiner Standarddatei sind SM-Aktivität, SM-Occupancy, ECC-Zähler, Zähler für Grenzwertverletzungen und NVLink-Fehler auskommentiert
- NVIDIA dokumentiert Row Remapping für Ampere-, Ada-, GH100- und GB10x-Chips, was die H200 NVL, L40S und L4 abdeckt; die Chips der RTX PRO Blackwell, GB202 und GB203, stehen nicht in seiner Tabelle
- In NVIDIAs XID-Katalog verlangen 64, 95, 119 und 120 einen sofortigen GPU-Reset, und sein Triage-Leitfaden weist an, einen Knoten zu leeren, der 79 protokolliert, also eine GPU, die vom Bus gefallen ist
Was DCGM abdeckt und auf welchen Karten
NVIDIAs Data Center GPU Manager, DCGM, ist „eine Sammlung von Werkzeugen zur Verwaltung und Überwachung von NVIDIA-Rechenzentrums-GPUs in Cluster-Umgebungen“, und dcgm-exporter macht aus seinen Feldern Prometheus-Metriken. DCGM unterstützt Rechenzentrums-GPUs ab Kepler und andere GPUs ab Maxwell, Letztere mit „eingeschränkter DCGM-Funktionalität“. Seine Funktionstabelle nutzt noch NVIDIAs alte Markennamen: Tesla, die Rechenzentrumslinie, bekommt alles; Quadro-, Titan- und GeForce-Karten bekommen Metriken, Konfiguration und Health Checks, aber keine Policy-Benachrichtigungen und nur die erste Diagnosestufe. Keine RTX-PRO-Blackwell-Karte wird genannt. Stattdessen nehmen die Release Notes sie einzeln auf, die RTX PRO 6000 Max-Q in DCGM 4.5.3 und eine Variante der RTX PRO 5000 in 4.6.0; 4.7.0 ist die neueste gelistete Version. Halten Sie DCGM aktuell, testen Sie, was es auf Workstation-Editionen meldet, und lesen Sie für die Treiberseite unseren Leitfaden zu Treibern und CUDA.
In NVIDIAs Quick-Start-Anleitung läuft dcgm-exporter als Container mit --cap-add SYS_, und DCGM weist darauf hin, dass Profiling-Zähler Administratorrechte brauchen. Die Metriken erscheinen auf Port 9400, wo curl localhost:9400/metrics sie anzeigt. Die Feldliste stammt aus /etc/dcgm-exporter/default-counters.csv, und -f verweist auf eine eigene.
Warum die GPU-Auslastung täuscht
nvidia-smi definiert die GPU-Auslastung als „Prozentsatz der Zeit im vergangenen Abtastzeitraum, in der ein oder mehrere Kernel auf der GPU ausgeführt wurden“, mit einem Abtastzeitraum von 1 bis 1/6 Sekunde je nach Produkt. Wie viel der GPU die Kernel nutzen, bleibt dabei unberücksichtigt. NVIDIAs eigenes DCGM-Beispiel: Auf einer GPU mit N Multiprozessoren ergibt ein Kernel mit N/5 Blöcken, der über das ganze Intervall läuft, eine SM-Aktivität von 0,2, während nach der obigen Definition 100 Prozent Auslastung angezeigt werden. Auf einer RTX PRO 6000 mit 188 Multiprozessoren ergibt ein einzelner beschäftigter Multiprozessor nach unserer Rechnung etwa 0,005. NVIDIAs Empfehlung: „Ein Wert von 0,8 oder mehr ist notwendig, aber nicht hinreichend für eine effektive Nutzung der GPU. Ein Wert unter 0,5 deutet wahrscheinlich auf eine ineffektive GPU-Nutzung hin.“
| METRIK | KLASSISCHES FELD | NAME IN DCGM 4.6 | NVIDIAS DEFINITION |
|---|---|---|---|
| GPU-Auslastung | DCGM_ | DCGM_ | Zeit, in der ein oder mehrere Kernel laufen |
| Grafik-Engine-Aktivität | DCGM_ | DCGM_ | Zeit, in der irgendeine Grafik- oder Compute-Engine aktiv war |
| SM-Aktivität | DCGM_ | DCGM_ | Zeit mit mindestens einem aktiven Warp, gemittelt über alle Multiprozessoren |
| SM-Occupancy | DCGM_ | DCGM_ | residente Warps im Verhältnis zum Maximum je Multiprozessor |
| Tensor-Aktivität | DCGM_ | DCGM_ | Zyklen mit aktiver Tensor-Pipe |
| Speicheraktivität | DCGM_ | DCGM_ | Zyklen, in denen Daten in den oder aus dem Gerätespeicher bewegt werden; etwa 0,8 ist das praktische Maximum |
NVIDIAs DCGM Feature Overview und die Release Notes zu 4.6.0, die die klassischen Namen als veraltete Aliasse behalten; GPU-Auslastung wie in der Dokumentation von nvidia-smi definiert.
Lesen Sie bei Sprachmodellen die letzten beiden Zeilen zusammen: Die Token-Erzeugung ist bei kleinen Batchgrößen durch die Speicherbandbreite begrenzt und die Prompt-Verarbeitung durch die Rechenleistung; erwarten Sie also bei einem Server, der für wenige Nutzer gleichzeitig generiert, hohe Speicheraktivität und mäßige Tensor-Aktivität. Die Standarddatei des Exporters aktiviert Grafik-Engine-, Tensor- und Speicheraktivität, lässt SM-Aktivität und Occupancy auskommentiert und nutzt noch die klassischen Namen.
Leistung, Temperatur und Clock Event Reasons
Leistungsaufnahme und Temperatur kommen aus DCGM_ und DCGM_, in Version 4.6 umbenannt in DCGM_ und DCGM_. Übernehmen Sie die Schwellwerte von der Karte: nvidia-smi meldet für jede GPU die Slowdown Temp, „die Temperatur, bei der die GPU-Hardware beginnt, die Takte wegen thermischer Bedingungen zu optimieren“, ihre Max Operating Temp und ihre Shutdown Temp, und DCGM hat Felder für alle drei.
Der Block Clocks Event Reasons von nvidia-smi -q, der heutige Name für das, was ältere Werkzeuge Throttle Reasons nannten, gibt an, warum die Takte sinken; DCGM hat DCGM_ zugunsten von DCGM_ als veraltet markiert. SW Power Cap hält die Takte niedrig, „weil die GPU zu viel Leistung aufnimmt“: Unter Volllast zeigt das eine Karte an ihrer Grenze, lesen Sie also das Enforced Power Limit daneben, und eine RTX PRO 6000, die sich auf 450 W statt 600 W begrenzt, deutet meist auf das Stromkabel hin, wie unser Leitfaden zur Stromversorgung im Rack erklärt. HW Slowdown senkt „die Kerntakte um den Faktor 2 oder mehr“, sobald HW Thermal Slowdown oder HW Power Brake aktiv ist, wobei die Bremse ein externes Signal ist, „z. B. durch das Netzteil des Systems“. SW Thermal Slowdown bedeutet, dass die GPU über ihrer Max Operating Temp liegt. Passive Karten erreichen diesen Punkt, wenn der Luftstrom im Gehäuse nicht ausreicht, die Grenze, die unser Leitfaden zu GPUs pro Server durchrechnet. Für Trends nutzen Sie die Zeitzähler: die Clock Event Reasons Counters von nvidia-smi und DCGMs DCGM_ und DCGM_, die in der Standard-Feldliste des Exporters auskommentiert sind.
ECC und Row Remapping
nvidia-smi unterteilt ECC-Fehler in korrigierbare und nicht korrigierbare, in SRAM und DRAM sowie in flüchtige Zählerstände seit dem letzten Laden des Treibers und aggregierte Zählerstände, die „unbegrenzt erhalten bleiben“. Die passenden Felder des Exporters, DCGM_ und die verwandten Felder, sind standardmäßig auskommentiert.
Row Remapping ersetzt eine fehlerhafte Speicherzeile durch eine der Reservezeilen, die jede DRAM-Bank mitbringt, bis zu 512 je GPU; das Remapping „erfordert einen GPU-Reset, um wirksam zu werden“, und gilt danach für die gesamte Lebensdauer der GPU. nvidia-smi -q -d ROW_ zeigt korrigierbare und nicht korrigierbare Remappings, Pending (ein Reset ist nötig), Remapping Failure Occurred und ein Histogramm der Reservezeilen, die jeder Bank noch bleiben. NVIDIAs RMA-Richtlinie markiert einen Row-Remapping-Fehlschlag, wenn ein Remapping für einen nicht korrigierbaren Fehler auf eine Bank trifft, die bereits acht nicht korrigierbare Remappings hat, oder auf eine bereits ersetzte Zeile, oder wenn es nach 512 nicht korrigierbaren Remappings erfolgt; die GPU kommt für eine RMA infrage, wenn diese Markierung gesetzt ist und NVIDIAs Felddiagnose sie bestätigt.
NVIDIAs Dokument zu Speicherfehlern führt Row Remapping für die Chips GA100, GA10x, Ada AD10x, GH100 und GB10x, Error Containment und Dynamic Page Offlining dagegen nur für GA100, GH100 und GB10x. Von unseren Karten bekommt die H200 NVL, ein GH100, alle drei; die L40S und die L4, beide Ada, bekommen Row Remapping. Das Dokument nennt Chips statt Speichertypen; für diese Karten heißt das HBM3e auf der H200 NVL und GDDR6 auf der L40S und L4. Die Chips der RTX PRO Blackwell, GB202 und GB203, stehen nicht darin, obwohl das Handbuch von nvidia-smi den Row Remapper als „auf Ampere+ verfügbar“ beschreibt; prüfen Sie also, was nvidia-smi -q -d ECC,ROW_ auf der gelieferten Karte meldet, bevor Sie Alarme dafür einrichten. Der Exporter enthält standardmäßig die Zählerstände der ersetzten Zeilen und das Fehler-Flag; DCGM_ muss ergänzt werden.
NVLink auf einer H200 NVL mit Brücke
Hopper nutzt NVLink der vierten Generation mit bis zu 18 Links je GPU, und der Product Brief der H200 NVL nennt 18. nvidia-smi nvlink -s zeigt den Zustand jedes Links und nvidia-smi nvlink -e seine Fehlerzähler, bei NVLink 4 Replay-, Recovery- und CRC-Fehler. DCGM hat Zähler für Flit-CRC-, Data-CRC-, Replay- und Recovery-Fehler, alle vier im Exporter auskommentiert; aktivieren Sie sie also auf Hosts mit Brücke und halten Sie den Link-Zustand nach der Installation fest. Ein ausfallender Link löst außerdem Xid 74 aus. Die Karten RTX PRO, L40S und L4 haben kein NVLink.
Die XID-Fehler, denen Sie tatsächlich begegnen
Ein Xid ist „ein Fehlerbericht des NVIDIA-Treibers, der in das Kernel-Log des Betriebssystems ausgegeben wird“, unter Linux eine Zeile, die NVRM: Xid enthält. Die Ursachen reichen von Hardware- und Treiberfehlern bis zu „einem Problem der Benutzeranwendung“. NVIDIAs Katalog deckt GPUs ab Ampere ab, PCIe-Karten eingeschlossen, und nennt für jeden Xid eine Sofortmaßnahme und eine Maßnahme zur Untersuchung.
| XID | NAME BEI NVIDIA | SOFORTMASSNAHME | BEDEUTUNG UND RAT |
|---|---|---|---|
| 13 | Graphics Engine Exception | RESTART_APP | typischerweise ein Anwendungsfehler wie ein Out-of-Bounds-Zugriff; DCGM-Diagnose ausführen, um Hardware auszuschließen |
| 31 | GPU memory page fault | RESTART_APP | ein unzulässiger Adresszugriff, typischerweise ein Anwendungsfehler, manchmal Treiber oder Hardware |
| 45 | Preemptive cleanup, due to previous errors | WORKFLOW_ | eine Anwendung wurde abgebrochen, etwa mit Strg+C oder durch einen GPU-Reset; nur zur Information |
| 48 | Double Bit ECC Error | WORKFLOW_ | nicht korrigierbarer Speicherfehler; folgt 63 oder 64, den Knoten leeren und die GPU zurücksetzen |
| 63 | GPU memory remapping event | IGNORE | der Row Remapper bei der Arbeit; wirksam beim nächsten GPU-Reset |
| 64 | GPU memory remapping failure | RESET_GPU | das Remapping ließ sich nicht festschreiben; GPU sofort zurücksetzen oder Knoten neu starten, dann den Support kontaktieren |
| 74 | NVLINK Error | WORKFLOW_ | ein Problem auf einem Link zu einer anderen GPU oder eine ausgefallene GPU am anderen Ende; ein GPU-Reset oder ein Neustart des Knotens behebt es |
| 79 | GPU has fallen off the bus | RESTART_BM | der Treiber erreicht die GPU nicht über PCIe; Knoten leeren und melden |
| 95 | Uncontained memory error | RESET_GPU | nur GPUs mit Containment; mit MIG die übrigen Instanzen leeren und zurücksetzen, ohne MIG sofort neu starten |
| 119 | GSP RPC Timeout | RESET_GPU | der GSP-Kern auf der GPU hat nicht rechtzeitig geantwortet; für 120, GSP Error, gilt dieselbe Maßnahme |
NVIDIAs Xid-Katalog (Sofortmaßnahmen, Auslösebedingungen) und GPU Debug Guidelines, September 2026. Bei Xid 94, dem eingedämmten Gegenstück zu 95, muss die betroffene Anwendung neu gestartet werden, andere Anwendungen laufen weiter, und NVIDIA empfiehlt einen GPU-Reset bei passender Gelegenheit.
DCGM_ im Exporter enthält nur den „Value of the last XID error encountered“; aktivieren Sie den auskommentierten Zähler DCGM_ oder sammeln Sie zusätzlich das Kernel-Log. Bevor Sie einen Supportfall eröffnen, führen Sie, wie im Triage-Leitfaden aufgeführt, nvidia-bug-report.sh als root und dcgmi diag -r 3 aus; außerhalb der Rechenzentrumslinie führt DCGM nur Stufe 1 aus.
nvidia-smi auf dem Knoten und Persistenz
nvidia-smi dmon überwacht bis zu 16 GPUs, standardmäßig Leistung, Temperatur, Takte und Auslastung, und -s wählt andere Metriksätze aus, darunter v für Verletzungen der Leistungs- und Temperaturgrenzen und e für ECC- und PCIe-Replay-Fehler. nvidia-smi pmon zeigt die Auslastung je Prozess. Beide eignen sich für einen Blick auf einen Knoten; Trends gehören in DCGM.
Von der Persistenz hängt ab, was die Zähler bedeuten. Ohne Client deinitialisiert der Treiber die GPU, was laut NVIDIA „zu langen Ladezeiten für jeden CUDA-Job führt, in der Größenordnung von Sekunden“, und löscht den Compute-Modus, die Application Clocks, eine Software-Leistungsgrenze und die flüchtigen ECC-Zählerstände. NVIDIA bezeichnet den alten Persistence Mode als „kurz vor dem End-of-Life“; nvidia-persistenced kommt mit dem Treiber, aber NVIDIA „kann nicht garantieren“, dass er standardmäßig läuft. Prüfen Sie also, ob er beim Booten startet.
Wofür Sie Alarme einrichten sollten: Beispiele
Diese Regeln sind unsere Beispiele, nicht die von NVIDIA; die rechte Spalte nennt die Aussage von NVIDIA, auf der jede beruht.
| SIGNAL | BEISPIELREGEL | GRUNDLAGE |
|---|---|---|
| Schwerer Xid | bei 48, 64, 74, 79, 95, 119 oder 120 die Rufbereitschaft alarmieren und der Maßnahme im Katalog folgen | der Katalog verlangt einen Reset, einen Neustart oder einen benannten Workflow |
| Row Remapping ausstehend | die GPU im nächsten Wartungsfenster zurücksetzen | das Remapping greift erst nach einem Reset |
| Row Remapping gescheitert | am selben Tag einen Fall beim Hersteller eröffnen | NVIDIAs RMA-Richtlinie |
| Hardware-Slowdown | alarmieren, wenn HW Slowdown länger als eine Minute anhält | Takte um die Hälfte oder mehr gesenkt |
| Thermische Reserve | bei 5 °C unter der eigenen Slowdown-Temperatur der Karte warnen | Slowdown Temp der Karte |
| Leistungsgrenze | alarmieren, wenn die wirksame Grenze unter dem Nennwert liegt und niemand eine Begrenzung gesetzt hat | Enforced Power Limit |
| NVLink-Fehler | bei jedem Anstieg der Replay-, Recovery- oder CRC-Zähler alarmieren | Zähler von nvidia-smi nvlink -e; Xid 74 braucht einen Reset oder Neustart |
| SM-Aktivität | Platzierung prüfen, wenn eine GPU im Serving-Betrieb unter 0,5 bleibt | NVIDIA: unter 0,5 wahrscheinlich ineffektiv |
Die Dauer von einer Minute, die Reserve von 5 °C und die Schwelle von 0,5 sind unsere Beispielwerte; testen Sie sie zuerst mit Ihren eigenen Daten.
Was wir liefern
Eurokommerz liefert RTX-PRO-Blackwell-Workstation-Karten von der RTX PRO 2000 bis zur RTX PRO 6000, die L4, die L40S und die H200 NVL EU-weit mit Herstellergarantie sowie nach Auftrag gebaute KI-Server, vor dem Versand unter Last getestet und auf Wunsch mit installiertem Betriebssystem, Treibern und Container-Runtime geliefert. Nennen Sie uns die Karten und Ihr aktuelles Monitoring, und wir sagen Ihnen, welche Felder und Alarme dazu passen.
FAQ
Warum zeigt nvidia-smi auf einer wenig belasteten GPU 100 Prozent GPU-Auslastung?
Welche DCGM-Metriken zeigen die echte GPU-Last?
Funktioniert DCGM auf RTX-PRO-Workstation-Karten?
Was bedeutet XID 79?
Welche GPUs unterstützen Row Remapping?
Sollte ich auf einem GPU-Server den Persistence Mode aktivieren?
Nennen Sie uns die Karten, die Zahl der Server und womit Sie sie heute überwachen. Wir sagen Ihnen, welche DCGM-Felder und Alarme zu diesen Karten passen und wo sich die Workstation-Editionen unterscheiden. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages