BLOG · GUIDE ·

XID 79 „GPU has fallen off the bus“: Ursachen, Prüfungen der Reihe nach und wann Sie einen Garantiefall eröffnen

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • XID 79 bedeutet, dass der NVIDIA-Treiber eine GPU über PCI Express erreichen wollte und sie nicht erreichbar war; NVIDIAs Xid-Katalog nennt einen Neustart des Systems (RESTART_BM) als Sofortmaßnahme und die Kontaktaufnahme mit dem Support als Maßnahme zur Untersuchung
  • NVIDIA nennt als Ursachenklassen Hardwarefehler auf dem PCIe-Link, ausfallende GPU-Hardware und Treiberprobleme und verweist für die Quelle des Linkausfalls auf das Systemereignisprotokoll und die PCI-Ereignisprotokolle des Kernels
  • Sichern Sie vor dem Neustart die Ausgabe von nvidia-bug-report.sh, das Kernel-Log und das BMC-Ereignisprotokoll; NVIDIAs Debug Guidelines sagen, den Knoten zu leeren und das Problem dem Systemanbieter zu melden
  • Prüfen Sie der Reihe nach: Link und Replays nach dem Neustart, Stromkabel und Netzteile, Kühlung, Sitz der Karte und Riser, Firmware, Treiber; tauschen Sie dann Steckplätze, um eine defekte Karte von einem defekten Steckplatz oder einer defekten Plattform zu unterscheiden
  • NVIDIA nennt seine Felddiagnose das maßgebliche Werkzeug für den Zustand von GPUs und sagt, dass sie in der Regel erforderlich ist, bevor eine RMA beginnen kann; wann und wie sie ausgeführt wird, sagt der Systemanbieter

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Was XID 79 „GPU has fallen off the bus“ bedeutet

XID 79 ist die Meldung des NVIDIA-Treibers, dass er eine GPU über ihre PCI-Express-Verbindung erreichen wollte und die GPU nicht erreichbar war. NVIDIAs Xid-Katalog (Release 615, 9. September 2026) nennt RESTART_BM als Sofortmaßnahme, definiert als „Bare Metal neu starten, das System sollte neu gestartet werden“, und CONTACT_SUPPORT als Maßnahme zur Untersuchung. Im Kernel-Log beginnt die Zeile mit NVRM: Xid und enthält die PCI-Adresse der betroffenen Karte, den Code 79 und den Text „GPU has fallen off the bus“.

Die Auslösebedingungen im Katalog nennen die Ursachenklassen. NVIDIA schreibt, dass das Ereignis „häufig durch Hardwarefehler auf dem PCI-Express-Link verursacht“ wird, dass auch ausfallende GPU-Hardware oder Treiberprobleme es auslösen können und dass Systemereignisprotokolle und PCI-Ereignisprotokolle des Kernels zeigen können, woher der Linkausfall kam. NVIDIAs GPU Debug Guidelines (aktualisiert am 4. Oktober 2026) ergänzen den operativen Schritt für 79: den Knoten leeren und das Problem melden. Der Katalog führt 79 außerdem unter den Codes, die ab Treiberzweig R565 Xid 154 auslösen, eine zweite Meldung, die die Wiederherstellungsmaßnahme nennt, zum Beispiel „Node Reboot Required“.

Die übrigen Codes stehen in unserer Referenz der NVIDIA-XID-Fehlercodes; dieser Artikel behandelt nur 79.

Erste Reaktion: Knoten leeren, Logs sichern, dann neu starten

Nehmen Sie den Knoten zuerst aus dem Load Balancer oder dem Scheduler, denn die Maßnahme des Katalogs für 79 ist ein Neustart des gesamten Systems. NVIDIAs Management Library gibt für eine solche Karte NVML_ERROR_GPU_IS_LOST zurück, beschrieben als „Die GPU ist vom Bus gefallen oder auf andere Weise unzugänglich geworden“. nvidia-smi bezieht einen großen Teil seiner Funktionen aus dieser Bibliothek, daher schlägt die Karte in seiner Ausgabe bis zum Neustart fehl oder fehlt ganz.

Sichern Sie die Belege vor dem Neustart, denn ein Reboot löscht den Nachrichtenpuffer des Kernels und auf Hosts, die das Kernel-Log nur in einem flüchtigen Journal halten, auch das Log. Laut NVIDIA wird nvidia-bug-report.sh mit dem Treiber installiert, läuft als root, schreibt eine Datei, nvidia-bug-report.log.gz, kann bis zu einer Stunde dauern und lässt sich mit --safe-mode --extra-system-data ausführen, wenn es hängt. Exportieren Sie auch das BMC-Ereignisprotokoll, notieren Sie die Uhrzeit der XID-Zeile und vergleichen Sie die Uhr des BMC mit der des Hosts, damit sich beide Logs zeitlich zuordnen lassen.

Ein GPU-Reset mit nvidia-smi -r kann den Hardware- und Softwarezustand der GPU „in Situationen, die sonst einen Neustart der Maschine erfordern würden“, zurücksetzen. Er verlangt root und keine Anwendungen auf der GPU, und NVIDIA gibt an, dass ein Reset nicht in jedem Fall gelingt, und schreibt: „Es wird derzeit nicht für Produktionsumgebungen empfohlen.“ Für 79 verlangt der Katalog einen Neustart des Systems statt eines GPU-Resets. Fehlt die Karte nach einem Warmstart noch, schalten Sie den Server vollständig aus; für eine GPU, die fehlerhaft bleibt, sagt die Dokumentation von nvidia-smi, „ein vollständiger Reset sollte durch Aus- und Wiedereinschalten des Knotens herbeigeführt werden“. Für Alarme bei 79 lesen Sie unseren Artikel zu DCGM-Metriken und XID-Fehlern.

Wo die Belege liegen: Kernel-Log, PCIe AER und BMC

NVIDIAs Xid-Dokumentation empfiehlt, in /var/log/messages oder /var/log/syslog nach „NVRM: Xid“ zu suchen, und journalctl -k zeigt die Kernel-Meldungen des aktuellen Boots einschließlich der Zeilen vor dem XID. Wo der PCIe-AER-Treiber von Linux Fehler behandelt, protokolliert er sie als Zeilen „PCIe Bus Error“ mit einem Schweregrad. Die Kernel-Dokumentation unterscheidet korrigierbare Fehler, die „keine Auswirkungen auf die Funktion der Schnittstelle haben“, von nicht fatalen Fehlern, bei denen der Link funktionsfähig bleibt, und von fatalen Fehlern, die „den Link unzuverlässig machen“.

Die Zähler je Gerät liegen in sysfs, in den Dateien aer_dev_correctable, aer_dev_nonfatal und aer_dev_fatal unter /sys/bus/pci/devices/ und der Adresse der Karte. Beide Dateien für nicht korrigierbare Fehler führen Fehlertypen wie Surprise Down Error und Completion Timeout, jeden mit eigenem Zähler. Lesen Sie sie an der GPU und am Port darüber. Linux behandelt AER nur, wenn die Firmware ihm über ACPI _OSC die Kontrolle überlässt; auf Plattformen, die das nicht tun, suchen Sie die Fehler im BMC-Ereignisprotokoll.

SYMPTOMPRÜFUNGQUELLE
Karte nach Neustart zurückLink-Generation, -Breite und „Replays Since Reset“ unter Last in nvidia-smi -qDokumentation von nvidia-smi
Fataler AER-Fehler vor XIDSitz der Karte, Riser und Riser-Kabel; aer_dev_fatal an GPU und vorgelagertem PortLinux-Kernel-Dokumentation zu AER
PCIe-Fehler im BMC-LogKnowledge Base des Server­herstellers und Firmware für BIOS, BMC und GPUNVIDIA Xid-Katalog
HW Power BrakeZahl und Leistung der Netzteile, GPU-Kabel für diesen Steckplatznvidia-smi; GPU-Regeln des Herstellers
HW Thermal SlowdownLüftermodule, Luftführung, Ansaugtemperaturnvidia-smi; Kühlregeln des Herstellers
Karte fehlt ab erstem StartLeistungs­klasse, die das 16-polige Kabel meldet, Teilenummer des Kabels je SteckplatzNVIDIA H200 NVL Product Brief

NVIDIA Xid-Katalog und Dokumentation von nvidia-smi, Linux-Kernel-Dokumentation zu PCIe AER und NVIDIA H200 NVL Product Brief PB-12128-001_v01, abgerufen am 10. Oktober 2026.

Reihenfolge der Fehlersuche bei XID 79

Halten Sie das Ergebnis jedes Schritts für den Fall fest.

  1. Notieren Sie die XID-Zeile, die PCI-Adresse, die Uhrzeit und den Workload, und sichern Sie die Ausgabe von nvidia-bug-report.sh und das BMC-Ereignisprotokoll vor jedem Neustart.
  2. Starten Sie den Host neu, mit vollständigem Ausschalten, wenn die Karte weiter fehlt, und lesen Sie dann Link-Generation, -Breite und Replays unter Last mit nvidia-smi -q.
  3. Prüfen Sie die Stromversorgung, also die Teilenummer des GPU-Kabels für diesen Steckplatz, die Netzteile, die der Serverhersteller für Ihre Zahl an GPUs verlangt, und die Clock Event Reason HW Power Brake unter Last.
  4. Prüfen Sie die Kühlung anhand der Regeln des Serverherstellers für Lüftermodule, Luftführung und Ansaugtemperatur, und beobachten Sie die Reason HW Thermal Slowdown unter Last.
  5. Stecken Sie die Karte neu und prüfen Sie den Riser und seine Kabel; der Katalog verlangt für die mechanische Prüfung mit eigenen Worten sicherzustellen, „dass das Gerät richtig sitzt und alle zugehörigen Verbindungen fest sind“.
  6. Vergleichen Sie die Firmware von BIOS, BMC, GPU und, wo der Server sie aufführt, der PCIe-Retimer mit den aktuellen Releases des Serverherstellers, und durchsuchen Sie seine Knowledge Base nach Ihrem Modell.
  7. Stellen Sie sicher, dass der Treiberzweig die Karte unterstützt, und lesen Sie die bekannten Probleme in den Release Notes dieses Zweigs.
  8. Tritt 79 erneut auf, tauschen Sie Steckplätze und führen Sie dcgmi diag -r 3 auf der betroffenen GPU aus, bevor Sie den Fall eröffnen.

nvidia-smi weist darauf hin, dass die aktuellen Link-Werte „niedriger sein können, wenn die GPU nicht genutzt wird“, lesen Sie sie also unter Last, und dass ein Überlauf des Replay-Zählers nach 4 aufeinanderfolgenden Replays „zu einem Retraining des Links führt“. Die Release Notes des Treibers 580.178.04 (Oktober 2026) führen unter den behobenen und den bekannten Problemen kein Problem mit XID 79.

Strom und Kühlung in Servern mit 4 bis 8 Karten

NVIDIAs Katalog nennt für 79 weder Strom noch Temperatur. Die Reihenfolge oben prüft beides früh, weil Serverhersteller eine GPU-Konfiguration nur unter festgelegten Bedingungen für Strom und Kühlung unterstützen.

Bei 600-W-Karten prüfen Sie zuerst das Stromkabel. Der Product Brief der H200 NVL (PB-12128-001_v01) markiert jede Leistungsklasse des 16-poligen Kabels von 450 W oder weniger mit „Not supported. Insufficient power“, und eine H200 NVL, deren Kabel weniger als ihre voreingestellte Leistungsgrenze meldet, „startet nicht“. Dieser Fehler zeigt sich als Karte, die ab dem ersten Einschalten fehlt, nicht als XID 79 bei einer Karte, die bereits gelaufen ist. NVIDIAs Brief zur RTX PRO 6000 Blackwell Server Edition (SP-12355-001_v02) führt einen 600-W- und einen 450-W-Modus. Lenovo Press LP2128 führt den SR650a V4 mit vier RTX PRO 6000 Server Edition nur bei einer Begrenzung des Steckplatzes auf 450 W, und mit zwei davon oder zwei H200 NVL bei 600 W. Prüfen Sie in einem Server mit 4 Karten, ob Kabel und Leistungsmodus dem entsprechen, was der Hersteller für den Steckplatz vorgibt.

Acht 600-W-Karten ziehen allein 4,8 kW, und Serverhersteller legen Zahl und Leistung der Netzteile je GPU-Anzahl fest, wie unser Vergleich, wie viele GPUs in einen Server passen, zeigt. In nvidia-smi bedeutet die Clock Event Reason HW Power Brake: „Eine externe Power-Brake-Assertion wird ausgelöst (z. B. durch das Netzteil des Systems)“. Lesen Sie sie mit nvidia-smi -q -d PERFORMANCE, während nach dem Neustart jede Karte unter Volllast läuft.

Passive Karten beziehen ihre Kühlung vom Gehäuse. NVIDIA schreibt, dass der Kühlkörper der H200 NVL „den Luftstrom des Systems benötigt, damit die Karte ordnungsgemäß arbeitet“, und der Brief erlaubt für die Karte 10 bis 45 °C Umgebungstemperatur. Serverhersteller setzen je Modell, Steckplatz und Lüftermodul niedrigere Grenzen für die Ansaugtemperatur, wie unsere Checkliste für die H200 NVL im vorhandenen Server zeigt. HW Thermal Slowdown meldet Takte, die „um den Faktor 2 oder mehr gesenkt wurden, weil die Temperatur zu hoch ist“. Wenn der BMC oder Ihr Monitoring die GPU-Temperaturen out-of-band aufzeichnet, lesen Sie die Minuten vor dem XID.

Wenn wir auf einem Gehäuse bauen, das Sie bereits besitzen, prüfen wir zuerst Plattform, Stromversorgung und Kühlung und sagen Ihnen vorab, wenn etwas nicht funktioniert. Nennen Sie uns das Servermodell, seine Steckplätze und die Karten, die Sie darin planen.

Defekte Karte oder Problem am Steckplatz: der Tauschtest

NVIDIA beschreibt die Maßnahme zur Untersuchung als Anleitung für ein Problem, das wiederkehrt oder unerwartet auftritt; ein zweiter XID 79 leitet also die Eingrenzung ein. Notieren Sie zuerst Seriennummer und Busadresse jeder Karte aus nvidia-smi -q, denn die Adresse gehört zum Steckplatz und die Seriennummer zur Karte.

Setzen Sie die betroffene Karte in einen Steckplatz, dessen GPU fehlerfrei gelaufen ist, und diese GPU in den verdächtigen Steckplatz, bei unverändertem Treiber und Workload. Nutzen Sie nur Steckplätze, die der Serverhersteller für diese Karte zulässt, mit dem Stromkabel, das der Steckplatz verlangt. Folgt der nächste XID der Seriennummer, steht die Karte unter Verdacht. Bleibt er beim Steckplatz, prüfen Sie den Riser, das Kabel des Steckplatzes und den PCIe-Switch oder Retimer in diesem Pfad. Treten XIDs abwechselnd auf verschiedenen GPUs auf, prüfen Sie die Plattform, also Firmware, Netzteile und Switch-Boards.

Führen Sie auf der versetzten Karte die DCGM-Diagnose mit dcgmi diag -r 3 -i 2 aus, wobei 2 ihre GPU-ID ist. Die DCGM-Dokumentation gibt für Stufe 3 unter 10 Minuten auf Hopper-Systemen mit 4 GPUs und unter 35 Minuten auf solchen mit 8 GPUs an; NVIDIAs Leitfaden zur GPU-Triage nennt für den langen Test etwa 30 Minuten. Der PCIe-Test lässt standardmäßig 80 Replays je GPU zu. Welche Stufen auf RTX-PRO-Karten laufen, behandelt unser Leitfaden zum Abnahmetest für GPU-Server.

Nehmen Sie als Beispiel einen Server mit acht RTX PRO 6000 Server Edition, je vier hinter einem PCIe-Switch, der 79 zweimal für eine Busadresse protokolliert. Ein dritter XID 79 an der neuen Adresse unter derselben Seriennummer weist auf die Karte. XIDs auf zwei Karten hinter einem Switch, mit einem fatalen Busfehler im BMC-Log, weisen auf den Pfad über den Switch, und zuerst ist der Support des Serverherstellers gefragt.

Was ein Garantiefall für XID 79 braucht

Eröffnen Sie den Fall, sobald 79 nach den Prüfungen oben wiederkehrt, wenn die Maßnahme zur Untersuchung aus dem Katalog greift, die Kontaktaufnahme mit dem Support. Wer ihn bearbeitet, der Lieferant der Karte oder der Serverhersteller, und welche Belege er akzeptiert, richtet sich nach den Garantiebedingungen dieser Partei. NVIDIAs Debug Guidelines führen auf, was ein Bericht über ein GPU-Problem enthalten soll, und enden mit „Reichen Sie ein Ticket bei Ihrem Systemanbieter ein“. Sie beschreiben NVIDIAs Felddiagnose außerdem als „das maßgebliche und umfassende NVIDIA-Werkzeug zur Bestimmung des Zustands von GPUs“, das „in der Regel erforderlich ist, bevor eine RMA eingeleitet werden kann“. Wann und wie sie ausgeführt wird, überlässt NVIDIA dem Systemanbieter.

BELEGSO ERFASSENVERLANGT VON
Betriebs­system und TreiberAusgabe von nvidia-bug-report.shNVIDIA Debug Guidelines
Wichtige Zeilen, volles LogKernel-Log mit XID- und AER-ZeilenNVIDIA Debug Guidelines
Debug-Schrittedie Reihenfolge der Fehlersuche oben, mit ErgebnissenNVIDIA Debug Guidelines
DCGM-Diagnoselogdcgmi diag -r 3, mit -j für JSONNVIDIA Debug Guidelines
BMC-Ereignis­protokollExport aus dem BMC, Uhrzeit des XID notiertunsere Empfehlung
Seriennummer und Steckplatznvidia-smi -q und das Etikett auf der Karteunsere Empfehlung
Felddiagnosenur auf Anweisung des Anbieters ausführenNVIDIA Debug Guidelines

NVIDIA GPU Debug Guidelines, GPU Node Triage, „Reporting a GPU Issue“ und „Running Field Diagnostics“, aktualisiert am 4. Oktober 2026; die Zeilen mit „unsere Empfehlung“ stammen von uns.

Bei GPUs, die wir liefern, läuft die Herstellergarantie über uns, und der Support kommt vom Serviceteam unseres Engineering-Partners. Schicken Sie uns die Karte, ihre Seriennummer und die XID-Zeilen über das Formular unten.

Was wir liefern

Wir liefern die Karten, um die es in diesem Artikel geht, die RTX PRO 6000 Server Edition und die H200 NVL mit ihren NVLink-Brücken, und bauen KI-Server auf Bestellung um sie herum, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente. Bei den professionellen NVIDIA-GPUs, die wir liefern, läuft die Herstellergarantie über uns, DOA-Geräte werden ersetzt, und der Support kommt vom Serviceteam unseres Engineering-Partners. Wenn wir auf Ihrem eigenen Gehäuse oder mit Teilen bauen, die Sie bereits besitzen, prüfen wir zuerst Plattform, Stromversorgung und Kühlung und sagen Ihnen vorab, wenn etwas nicht funktioniert. Konfiguration und Angebot folgen innerhalb eines Werktages, unter einem EU-Vertrag und auf einer Rechnung.

FAQ

Was bedeutet XID 79?
XID 79 ist die Meldung des NVIDIA-Treibers, dass er eine GPU über ihre PCI-Express-Verbindung erreichen wollte und sie nicht erreichbar war, protokolliert als „GPU has fallen off the bus“. NVIDIAs Xid-Katalog nennt einen Neustart des Systems als Sofortmaßnahme und die Kontaktaufnahme mit dem Support als Maßnahme zur Untersuchung. Als Ursachenklassen nennt er Hardwarefehler auf dem PCIe-Link, ausfallende GPU-Hardware und Treiberprobleme.
Wie kann ich XID 79 „GPU has fallen off the bus“ beheben?
Leeren Sie den Knoten, sichern Sie die Ausgabe von nvidia-bug-report.sh, das Kernel-Log und das BMC-Ereignisprotokoll und starten Sie den Host dann neu, mit vollständigem Ausschalten, wenn die Karte weiter fehlt. Tritt der Fehler erneut auf, prüfen Sie in dieser Reihenfolge PCIe-Link und Replays, Stromkabel und Netzteile, Kühlung, Sitz der Karte und Riser, Firmware und Treiber. Ein Tausch der Steckplätze und die DCGM-Diagnose zeigen dann, ob die Karte oder der Steckplatz die Ursache ist.
Warum zeigt nvidia-smi nach XID 79 keine GPU mehr an?
nvidia-smi bezieht einen großen Teil seiner Funktionen aus NVIDIAs Management Library, die für eine GPU, die vom Bus gefallen oder auf andere Weise unzugänglich geworden ist, NVML_ERROR_GPU_IS_LOST zurückgibt. Die Karte schlägt in seiner Ausgabe daher fehl oder fehlt, bis das System neu gestartet wird, die Maßnahme, die NVIDIAs Katalog für XID 79 nennt. Fehlt sie nach einem Warmstart noch, schalten Sie den Server vollständig aus und prüfen Sie Link und Sitz der Karte.
Kann ich nach XID 79 die GPU zurücksetzen, statt neu zu starten?
NVIDIAs Katalog nennt für XID 79 einen Neustart des Systems, keinen GPU-Reset, als Sofortmaßnahme. Ein Reset mit nvidia-smi -r braucht root und keine Anwendungen auf der GPU, und NVIDIA gibt an, dass er nicht in jedem Fall gelingt und derzeit nicht für Produktionsumgebungen empfohlen wird. Planen Sie ein, dass der Host ausfällt, und leeren Sie ihn vorher.
Ist die Ursache von XID 79 ein Hardwaredefekt?
NVIDIA schreibt, dass das Ereignis häufig durch Hardwarefehler auf dem PCI-Express-Link verursacht wird und auch von ausfallender GPU-Hardware oder Treiberproblemen kommen kann. Ein Tausch der Steckplätze zeigt, ob der Fehler der Karte folgt, beim Steckplatz bleibt oder zwischen GPUs wandert, was auf die Karte, den Pfad zum Steckplatz oder die Plattform weist.
Was brauche ich für eine RMA nach XID 79?
NVIDIAs Debug Guidelines verlangen die Angaben zu Betriebssystem und Treiber, die wichtigen Logzeilen und das vollständige Log, die durchgeführten Debug-Schritte, die Ausgabe von nvidia-bug-report.sh und die Logs der DCGM-Diagnose, eingereicht beim Systemanbieter. NVIDIAs Felddiagnose ist in der Regel erforderlich, bevor eine RMA beginnen kann, und der Systemanbieter sagt, wann und wie sie ausgeführt wird. Ergänzen Sie Seriennummer und Steckplatz der Karte sowie das BMC-Ereignisprotokoll, und folgen Sie den Garantiebedingungen des Lieferanten oder Herstellers.

Schicken Sie uns das Servermodell, die GPU-Karten und die Steckplätze, in denen sie stecken, die XID-Zeilen mit ihren PCI-Adressen und die eingebauten Netzteile. Wir antworten innerhalb eines Werktages; bei Karten, die Sie bei uns gekauft haben, läuft die Herstellergarantie über uns.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien