BLOG · GUIDE ·

GPU-Server im Produktivbetrieb überwachen: DCGM-Metriken, Clock Event Reasons, Speicherfehler und XIDs

IN KÜRZE
  • Die GPU-Auslastung zählt die Zeit, in der irgendein Kernel läuft, also ergibt ein Kernel, der ein Fünftel der Multiprozessoren über das ganze Intervall beschäftigt, trotzdem 100 Prozent; DCGMs SM-Aktivität liegt dafür bei 0,2, und NVIDIA bezeichnet 0,8 oder mehr als notwendig, aber nicht hinreichend
  • DCGM 4.6 hat seine Felder umbenannt, darunter DCGM_FI_DEV_GPU_UTIL in DCGM_FI_DEV_GPU_UTIL_RATIO, und behält die alten Namen als veraltete Aliasse; die Standarddatei von dcgm-exporter nutzt noch die alten
  • dcgm-exporter liefert Prometheus-Metriken auf Port 9400, aber in seiner Standarddatei sind SM-Aktivität, SM-Occupancy, ECC-Zähler, Zähler für Grenzwertverletzungen und NVLink-Fehler auskommentiert
  • NVIDIA dokumentiert Row Remapping für Ampere-, Ada-, GH100- und GB10x-Chips, was die H200 NVL, L40S und L4 abdeckt; die Chips der RTX PRO Blackwell, GB202 und GB203, stehen nicht in seiner Tabelle
  • In NVIDIAs XID-Katalog verlangen 64, 95, 119 und 120 einen sofortigen GPU-Reset, und sein Triage-Leitfaden weist an, einen Knoten zu leeren, der 79 protokolliert, also eine GPU, die vom Bus gefallen ist

Was DCGM abdeckt und auf welchen Karten

NVIDIAs Data Center GPU Manager, DCGM, ist „eine Sammlung von Werkzeugen zur Verwaltung und Überwachung von NVIDIA-Rechenzentrums-GPUs in Cluster-Umgebungen“, und dcgm-exporter macht aus seinen Feldern Prometheus-Metriken. DCGM unterstützt Rechenzentrums-GPUs ab Kepler und andere GPUs ab Maxwell, Letztere mit „eingeschränkter DCGM-Funktionalität“. Seine Funktionstabelle nutzt noch NVIDIAs alte Markennamen: Tesla, die Rechenzentrumslinie, bekommt alles; Quadro-, Titan- und GeForce-Karten bekommen Metriken, Konfiguration und Health Checks, aber keine Policy-Benachrichtigungen und nur die erste Diagnosestufe. Keine RTX-PRO-Blackwell-Karte wird genannt. Stattdessen nehmen die Release Notes sie einzeln auf, die RTX PRO 6000 Max-Q in DCGM 4.5.3 und eine Variante der RTX PRO 5000 in 4.6.0; 4.7.0 ist die neueste gelistete Version. Halten Sie DCGM aktuell, testen Sie, was es auf Workstation-Editionen meldet, und lesen Sie für die Treiberseite unseren Leitfaden zu Treibern und CUDA.

In NVIDIAs Quick-Start-Anleitung läuft dcgm-exporter als Container mit --cap-add SYS_ADMIN, und DCGM weist darauf hin, dass Profiling-Zähler Administratorrechte brauchen. Die Metriken erscheinen auf Port 9400, wo curl localhost:9400/metrics sie anzeigt. Die Feldliste stammt aus /etc/dcgm-exporter/default-counters.csv, und -f verweist auf eine eigene.

Warum die GPU-Auslastung täuscht

nvidia-smi definiert die GPU-Auslastung als „Prozentsatz der Zeit im vergangenen Abtastzeitraum, in der ein oder mehrere Kernel auf der GPU ausgeführt wurden“, mit einem Abtastzeitraum von 1 bis 1/6 Sekunde je nach Produkt. Wie viel der GPU die Kernel nutzen, bleibt dabei unberücksichtigt. NVIDIAs eigenes DCGM-Beispiel: Auf einer GPU mit N Multiprozessoren ergibt ein Kernel mit N/5 Blöcken, der über das ganze Intervall läuft, eine SM-Aktivität von 0,2, während nach der obigen Definition 100 Prozent Auslastung angezeigt werden. Auf einer RTX PRO 6000 mit 188 Multiprozessoren ergibt ein einzelner beschäftigter Multiprozessor nach unserer Rechnung etwa 0,005. NVIDIAs Empfehlung: „Ein Wert von 0,8 oder mehr ist notwendig, aber nicht hinreichend für eine effektive Nutzung der GPU. Ein Wert unter 0,5 deutet wahrscheinlich auf eine ineffektive GPU-Nutzung hin.“

METRIKKLASSISCHES FELDNAME IN DCGM 4.6NVIDIAS DEFINITION
GPU-AuslastungDCGM_FI_DEV_GPU_UTILDCGM_FI_DEV_GPU_UTIL_RATIOZeit, in der ein oder mehrere Kernel laufen
Grafik-Engine-AktivitätDCGM_FI_PROF_GR_ENGINE_ACTIVEDCGM_FI_PROF_GR_ENGINE_UTIL_RATIOZeit, in der irgendeine Grafik- oder Compute-Engine aktiv war
SM-AktivitätDCGM_FI_PROF_SM_ACTIVEDCGM_FI_PROF_SM_UTIL_RATIOZeit mit mindestens einem aktiven Warp, gemittelt über alle Multiprozessoren
SM-OccupancyDCGM_FI_PROF_SM_OCCUPANCYDCGM_FI_PROF_SM_OCCUPANCY_RATIOresidente Warps im Verhältnis zum Maximum je Multiprozessor
Tensor-AktivitätDCGM_FI_PROF_PIPE_TENSOR_ACTIVEDCGM_FI_PROF_TENSOR_UTIL_RATIOZyklen mit aktiver Tensor-Pipe
SpeicheraktivitätDCGM_FI_PROF_DRAM_ACTIVEDCGM_FI_PROF_DRAM_UTIL_RATIOZyklen, in denen Daten in den oder aus dem Gerätespeicher bewegt werden; etwa 0,8 ist das praktische Maximum

NVIDIAs DCGM Feature Overview und die Release Notes zu 4.6.0, die die klassischen Namen als veraltete Aliasse behalten; GPU-Auslastung wie in der Dokumentation von nvidia-smi definiert.

Lesen Sie bei Sprachmodellen die letzten beiden Zeilen zusammen: Die Token-Erzeugung ist bei kleinen Batchgrößen durch die Speicherbandbreite begrenzt und die Prompt-Verarbeitung durch die Rechenleistung; erwarten Sie also bei einem Server, der für wenige Nutzer gleichzeitig generiert, hohe Speicheraktivität und mäßige Tensor-Aktivität. Die Standarddatei des Exporters aktiviert Grafik-Engine-, Tensor- und Speicheraktivität, lässt SM-Aktivität und Occupancy auskommentiert und nutzt noch die klassischen Namen.

Leistung, Temperatur und Clock Event Reasons

Leistungsaufnahme und Temperatur kommen aus DCGM_FI_DEV_POWER_USAGE und DCGM_FI_DEV_GPU_TEMP, in Version 4.6 umbenannt in DCGM_FI_DEV_BOARD_POWER_WATTS und DCGM_FI_DEV_GPU_TEMP_CELSIUS. Übernehmen Sie die Schwellwerte von der Karte: nvidia-smi meldet für jede GPU die Slowdown Temp, „die Temperatur, bei der die GPU-Hardware beginnt, die Takte wegen thermischer Bedingungen zu optimieren“, ihre Max Operating Temp und ihre Shutdown Temp, und DCGM hat Felder für alle drei.

Der Block Clocks Event Reasons von nvidia-smi -q, der heutige Name für das, was ältere Werkzeuge Throttle Reasons nannten, gibt an, warum die Takte sinken; DCGM hat DCGM_FI_DEV_CLOCK_THROTTLE_REASONS zugunsten von DCGM_FI_DEV_CLOCKS_EVENT_REASONS als veraltet markiert. SW Power Cap hält die Takte niedrig, „weil die GPU zu viel Leistung aufnimmt“: Unter Volllast zeigt das eine Karte an ihrer Grenze, lesen Sie also das Enforced Power Limit daneben, und eine RTX PRO 6000, die sich auf 450 W statt 600 W begrenzt, deutet meist auf das Stromkabel hin, wie unser Leitfaden zur Stromversorgung im Rack erklärt. HW Slowdown senkt „die Kerntakte um den Faktor 2 oder mehr“, sobald HW Thermal Slowdown oder HW Power Brake aktiv ist, wobei die Bremse ein externes Signal ist, „z. B. durch das Netzteil des Systems“. SW Thermal Slowdown bedeutet, dass die GPU über ihrer Max Operating Temp liegt. Passive Karten erreichen diesen Punkt, wenn der Luftstrom im Gehäuse nicht ausreicht, die Grenze, die unser Leitfaden zu GPUs pro Server durchrechnet. Für Trends nutzen Sie die Zeitzähler: die Clock Event Reasons Counters von nvidia-smi und DCGMs DCGM_FI_DEV_POWER_VIOLATION und DCGM_FI_DEV_THERMAL_VIOLATION, die in der Standard-Feldliste des Exporters auskommentiert sind.

ECC und Row Remapping

nvidia-smi unterteilt ECC-Fehler in korrigierbare und nicht korrigierbare, in SRAM und DRAM sowie in flüchtige Zählerstände seit dem letzten Laden des Treibers und aggregierte Zählerstände, die „unbegrenzt erhalten bleiben“. Die passenden Felder des Exporters, DCGM_FI_DEV_ECC_DBE_VOL_TOTAL und die verwandten Felder, sind standardmäßig auskommentiert.

Row Remapping ersetzt eine fehlerhafte Speicherzeile durch eine der Reservezeilen, die jede DRAM-Bank mitbringt, bis zu 512 je GPU; das Remapping „erfordert einen GPU-Reset, um wirksam zu werden“, und gilt danach für die gesamte Lebensdauer der GPU. nvidia-smi -q -d ROW_REMAPPER zeigt korrigierbare und nicht korrigierbare Remappings, Pending (ein Reset ist nötig), Remapping Failure Occurred und ein Histogramm der Reservezeilen, die jeder Bank noch bleiben. NVIDIAs RMA-Richtlinie markiert einen Row-Remapping-Fehlschlag, wenn ein Remapping für einen nicht korrigierbaren Fehler auf eine Bank trifft, die bereits acht nicht korrigierbare Remappings hat, oder auf eine bereits ersetzte Zeile, oder wenn es nach 512 nicht korrigierbaren Remappings erfolgt; die GPU kommt für eine RMA infrage, wenn diese Markierung gesetzt ist und NVIDIAs Felddiagnose sie bestätigt.

NVIDIAs Dokument zu Speicherfehlern führt Row Remapping für die Chips GA100, GA10x, Ada AD10x, GH100 und GB10x, Error Containment und Dynamic Page Offlining dagegen nur für GA100, GH100 und GB10x. Von unseren Karten bekommt die H200 NVL, ein GH100, alle drei; die L40S und die L4, beide Ada, bekommen Row Remapping. Das Dokument nennt Chips statt Speichertypen; für diese Karten heißt das HBM3e auf der H200 NVL und GDDR6 auf der L40S und L4. Die Chips der RTX PRO Blackwell, GB202 und GB203, stehen nicht darin, obwohl das Handbuch von nvidia-smi den Row Remapper als „auf Ampere+ verfügbar“ beschreibt; prüfen Sie also, was nvidia-smi -q -d ECC,ROW_REMAPPER auf der gelieferten Karte meldet, bevor Sie Alarme dafür einrichten. Der Exporter enthält standardmäßig die Zählerstände der ersetzten Zeilen und das Fehler-Flag; DCGM_FI_DEV_ROW_REMAP_PENDING muss ergänzt werden.

NVLink auf einer H200 NVL mit Brücke

Hopper nutzt NVLink der vierten Generation mit bis zu 18 Links je GPU, und der Product Brief der H200 NVL nennt 18. nvidia-smi nvlink -s zeigt den Zustand jedes Links und nvidia-smi nvlink -e seine Fehlerzähler, bei NVLink 4 Replay-, Recovery- und CRC-Fehler. DCGM hat Zähler für Flit-CRC-, Data-CRC-, Replay- und Recovery-Fehler, alle vier im Exporter auskommentiert; aktivieren Sie sie also auf Hosts mit Brücke und halten Sie den Link-Zustand nach der Installation fest. Ein ausfallender Link löst außerdem Xid 74 aus. Die Karten RTX PRO, L40S und L4 haben kein NVLink.

Die XID-Fehler, denen Sie tatsächlich begegnen

Ein Xid ist „ein Fehlerbericht des NVIDIA-Treibers, der in das Kernel-Log des Betriebssystems ausgegeben wird“, unter Linux eine Zeile, die NVRM: Xid enthält. Die Ursachen reichen von Hardware- und Treiberfehlern bis zu „einem Problem der Benutzeranwendung“. NVIDIAs Katalog deckt GPUs ab Ampere ab, PCIe-Karten eingeschlossen, und nennt für jeden Xid eine Sofortmaßnahme und eine Maßnahme zur Untersuchung.

XIDNAME BEI NVIDIASOFORTMASSNAHMEBEDEUTUNG UND RAT
13Graphics Engine ExceptionRESTART_APPtypischerweise ein Anwendungsfehler wie ein Out-of-Bounds-Zugriff; DCGM-Diagnose ausführen, um Hardware auszuschließen
31GPU memory page faultRESTART_APPein unzulässiger Adresszugriff, typischerweise ein Anwendungsfehler, manchmal Treiber oder Hardware
45Preemptive cleanup, due to previous errorsWORKFLOW_XID_45eine Anwendung wurde abgebrochen, etwa mit Strg+C oder durch einen GPU-Reset; nur zur Information
48Double Bit ECC ErrorWORKFLOW_XID_48nicht korrigierbarer Speicherfehler; folgt 63 oder 64, den Knoten leeren und die GPU zurücksetzen
63GPU memory remapping eventIGNOREder Row Remapper bei der Arbeit; wirksam beim nächsten GPU-Reset
64GPU memory remapping failureRESET_GPUdas Remapping ließ sich nicht festschreiben; GPU sofort zurücksetzen oder Knoten neu starten, dann den Support kontaktieren
74NVLINK ErrorWORKFLOW_NVLINK_ERRein Problem auf einem Link zu einer anderen GPU oder eine ausgefallene GPU am anderen Ende; ein GPU-Reset oder ein Neustart des Knotens behebt es
79GPU has fallen off the busRESTART_BMder Treiber erreicht die GPU nicht über PCIe; Knoten leeren und melden
95Uncontained memory errorRESET_GPUnur GPUs mit Containment; mit MIG die übrigen Instanzen leeren und zurücksetzen, ohne MIG sofort neu starten
119GSP RPC TimeoutRESET_GPUder GSP-Kern auf der GPU hat nicht rechtzeitig geantwortet; für 120, GSP Error, gilt dieselbe Maßnahme

NVIDIAs Xid-Katalog (Sofortmaßnahmen, Auslösebedingungen) und GPU Debug Guidelines, September 2026. Bei Xid 94, dem eingedämmten Gegenstück zu 95, muss die betroffene Anwendung neu gestartet werden, andere Anwendungen laufen weiter, und NVIDIA empfiehlt einen GPU-Reset bei passender Gelegenheit.

DCGM_FI_DEV_XID_ERRORS im Exporter enthält nur den „Value of the last XID error encountered“; aktivieren Sie den auskommentierten Zähler DCGM_EXP_XID_ERRORS_TOTAL oder sammeln Sie zusätzlich das Kernel-Log. Bevor Sie einen Supportfall eröffnen, führen Sie, wie im Triage-Leitfaden aufgeführt, nvidia-bug-report.sh als root und dcgmi diag -r 3 aus; außerhalb der Rechenzentrumslinie führt DCGM nur Stufe 1 aus.

nvidia-smi auf dem Knoten und Persistenz

nvidia-smi dmon überwacht bis zu 16 GPUs, standardmäßig Leistung, Temperatur, Takte und Auslastung, und -s wählt andere Metriksätze aus, darunter v für Verletzungen der Leistungs- und Temperaturgrenzen und e für ECC- und PCIe-Replay-Fehler. nvidia-smi pmon zeigt die Auslastung je Prozess. Beide eignen sich für einen Blick auf einen Knoten; Trends gehören in DCGM.

Von der Persistenz hängt ab, was die Zähler bedeuten. Ohne Client deinitialisiert der Treiber die GPU, was laut NVIDIA „zu langen Ladezeiten für jeden CUDA-Job führt, in der Größenordnung von Sekunden“, und löscht den Compute-Modus, die Application Clocks, eine Software-Leistungsgrenze und die flüchtigen ECC-Zählerstände. NVIDIA bezeichnet den alten Persistence Mode als „kurz vor dem End-of-Life“; nvidia-persistenced kommt mit dem Treiber, aber NVIDIA „kann nicht garantieren“, dass er standardmäßig läuft. Prüfen Sie also, ob er beim Booten startet.

Wofür Sie Alarme einrichten sollten: Beispiele

Diese Regeln sind unsere Beispiele, nicht die von NVIDIA; die rechte Spalte nennt die Aussage von NVIDIA, auf der jede beruht.

SIGNALBEISPIELREGELGRUNDLAGE
Schwerer Xidbei 48, 64, 74, 79, 95, 119 oder 120 die Rufbereitschaft alarmieren und der Maßnahme im Katalog folgender Katalog verlangt einen Reset, einen Neustart oder einen benannten Workflow
Row Remapping ausstehenddie GPU im nächsten Wartungsfenster zurücksetzendas Remapping greift erst nach einem Reset
Row Remapping gescheitertam selben Tag einen Fall beim Hersteller eröffnenNVIDIAs RMA-Richtlinie
Hardware-Slowdownalarmieren, wenn HW Slowdown länger als eine Minute anhältTakte um die Hälfte oder mehr gesenkt
Thermische Reservebei 5 °C unter der eigenen Slowdown-Temperatur der Karte warnenSlowdown Temp der Karte
Leistungsgrenzealarmieren, wenn die wirksame Grenze unter dem Nennwert liegt und niemand eine Begrenzung gesetzt hatEnforced Power Limit
NVLink-Fehlerbei jedem Anstieg der Replay-, Recovery- oder CRC-Zähler alarmierenZähler von nvidia-smi nvlink -e; Xid 74 braucht einen Reset oder Neustart
SM-AktivitätPlatzierung prüfen, wenn eine GPU im Serving-Betrieb unter 0,5 bleibtNVIDIA: unter 0,5 wahrscheinlich ineffektiv

Die Dauer von einer Minute, die Reserve von 5 °C und die Schwelle von 0,5 sind unsere Beispielwerte; testen Sie sie zuerst mit Ihren eigenen Daten.

Was wir liefern

Eurokommerz liefert RTX-PRO-Blackwell-Workstation-Karten von der RTX PRO 2000 bis zur RTX PRO 6000, die L4, die L40S und die H200 NVL EU-weit mit Herstellergarantie sowie nach Auftrag gebaute KI-Server, vor dem Versand unter Last getestet und auf Wunsch mit installiertem Betriebssystem, Treibern und Container-Runtime geliefert. Nennen Sie uns die Karten und Ihr aktuelles Monitoring, und wir sagen Ihnen, welche Felder und Alarme dazu passen.

FAQ

Warum zeigt nvidia-smi auf einer wenig belasteten GPU 100 Prozent GPU-Auslastung?
Die Auslastung ist der Anteil der Zeit, in der ein oder mehrere Kernel liefen, nicht, wie viel der GPU sie nutzten. DCGMs SM-Aktivität mittelt über alle Multiprozessoren: In NVIDIAs eigenem Beispiel ergibt ein Kernel, der ein Fünftel davon über das ganze Intervall beschäftigt, 0,2.
Welche DCGM-Metriken zeigen die echte GPU-Last?
SM-Aktivität, SM-Occupancy, Tensor-Aktivität und Speicheraktivität, die Profiling-Felder DCGM_FI_PROF_SM_ACTIVE, SM_OCCUPANCY, PIPE_TENSOR_ACTIVE und DRAM_ACTIVE, die DCGM 4.6 in Namen mit der Endung _RATIO umbenannt hat. NVIDIA bezeichnet eine SM-Aktivität von 0,8 oder mehr als notwendig, aber nicht hinreichend für eine effektive Nutzung.
Funktioniert DCGM auf RTX-PRO-Workstation-Karten?
Mit Einschränkungen. DCGMs Funktionstabelle sieht für Karten außerhalb der Rechenzentrumslinie Metriken, Konfiguration und Health Checks vor, aber keine Policy-Benachrichtigungen und nur Diagnosen der Stufe 1, und seine Release Notes nehmen RTX-PRO-Modelle einzeln auf, zum Beispiel die RTX PRO 6000 Max-Q in 4.5.3.
Was bedeutet XID 79?
Die GPU ist vom Bus gefallen: Der Treiber hat versucht, sie über PCI Express zu erreichen, und sie als nicht erreichbar vorgefunden. NVIDIAs Katalog nennt RESTART_BM als Sofortmaßnahme, und sein Triage-Leitfaden weist an, den Knoten zu leeren und das Problem zu melden.
Welche GPUs unterstützen Row Remapping?
NVIDIAs Dokument zu Speicherfehlern führt die Chips GA100, GA10x, Ada AD10x, GH100 und GB10x, was die H200 NVL, L40S und L4 einschließt. Die Chips der RTX PRO Blackwell stehen nicht in der Tabelle; prüfen Sie also nvidia-smi -q -d ROW_REMAPPER auf der Karte selbst.
Sollte ich auf einem GPU-Server den Persistence Mode aktivieren?
Halten Sie den Treiber geladen, aber mit dem Persistence-Daemon nvidia-persistenced, den NVIDIA seinen Kunden statt des alten Modus nahelegt, der laut NVIDIA kurz vor dem End-of-Life steht. Ohne ihn werden flüchtige ECC-Zählerstände und eine Software-Leistungsgrenze jedes Mal gelöscht, wenn die GPU deinitialisiert wird.

Nennen Sie uns die Karten, die Zahl der Server und womit Sie sie heute überwachen. Wir sagen Ihnen, welche DCGM-Felder und Alarme zu diesen Karten passen und wo sich die Workstation-Editionen unterscheiden. Wir antworten innerhalb eines Werktages.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at  ·  +43 1 585 1405 50  ·  Jordangasse 7, 1010 Wien