BLOG · GUIDE ·

GPU Out-of-Band Monitoring: was BMC und Redfish zeigen und was nur DCGM in-band sieht

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • GPU Out-of-Band Monitoring liest die Karten über den BMC des Servers an dessen eigenem Management-Port aus, ohne das Betriebssystem; NVIDIAs Product Brief zur RTX PRO 6000 Server Edition ergänzt, dass der SMBPBI-Kanal der Karte für die Leistungsgrenze für die volle Funktionalität den geladenen Treiber braucht, und Xid-Fehler bleiben in-band im Kernel-Log
  • NVIDIAs Product Briefs zur H200 NVL und zur RTX PRO 6000 Server Edition führen SMBPBI, das SMBus Post-Box Interface, als unterstützt und sagen, dass eine darüber gesetzte Leistungsgrenze über das Laden des Treibers und Systemstarts hinweg gilt, während eine mit nvidia-smi gesetzte nach jedem Laden des Treibers neu gesetzt werden muss
  • Redfish 2026.2 beschreibt eine GPU als Processor vom Typ GPU, mit EnvironmentMetrics für Temperatur, Leistungsaufnahme und Leistungsgrenze und ProcessorMetrics für Bandbreite, Fehlerzähler und Drosselungsdauern; welche davon er füllt, entscheidet jeder BMC
  • Dells iDRAC-Telemetrie führt 40 GPU-Metriken, darunter SM-Aktivität und NVLink-Fehlerbits, sowie 16 Speicherfehlerzähler, unter einer iDRAC-Lizenz „Datacenter“; Lenovo XCC2 dokumentiert einen GPU-Leistungssensor und eine Leistungsgrenze, Supermicro einen Inventar-Reiter für GPUs
  • Führen Sie bei 2 bis 4 GPU-Servern BMC-Ereignisse und DCGM-Metriken in einem Monitoring-System zusammen, und halten Sie in einem Wartungsfenster fest, welche GPU-Werte der BMC bei entladenem NVIDIA-Treiber noch meldet

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

GPU Out-of-Band Monitoring: was der BMC sieht und was nicht

GPU Out-of-Band Monitoring liest die GPUs über den Baseboard Management Controller (BMC) des Servers an dessen eigenem Management-Port aus statt über das Betriebssystem. Bei Rechenzentrumskarten erreicht der BMC die GPU über den SMBus, über NVIDIAs SMBus Post-Box Interface (SMBPBI), wo der Serverhersteller es implementiert, und die Hersteller dokumentieren Temperatur, Leistungsaufnahme der Karte und Zustandsdaten in Redfish und in ihren Webkonsolen. Vom Treiber ist dieser Pfad allerdings nicht völlig unabhängig: NVIDIAs Product Brief zur RTX PRO 6000 Server Edition sagt, dass ihr SMBPBI-Kanal für die Leistungsgrenze „außerdem voraussetzt, dass der NVIDIA-Treiber für die volle Funktionalität geladen ist“. Die Details, die einen langsamen oder abgebrochenen Job erklären, vor allem Xid-Fehler, kommen in-band vom Treiber, über nvidia-smi und NVIDIAs Data Center GPU Manager (DCGM), und sie enden, wenn der Host oder der Treiber stoppt.

Wie viel der BMC über Temperatur und Leistungsaufnahme hinaus zeigt, hängt vom Serverhersteller ab. Dells iDRAC-Telemetrie führt 40 GPU-Metriken, darunter SM-Aktivität und NVLink-Fehlerflags, während andere Hersteller für PCIe-GPUs wenig mehr als Inventar und Leistungsaufnahme dokumentieren. Ein Standort mit 2 bis 4 GPU-Servern braucht deshalb beide Pfade in einem Monitoring-System: den BMC für die Werte, die einen hängenden Host überstehen müssen, und DCGM für die Zähler, die nur der Treiber hat. Die zitierten Dokumente haben den Stand Oktober 2026.

Wie der BMC eine PCIe-GPU ausliest: SMBus und SMBPBI

Eine Rechenzentrums-GPU hat eine eigene Managementschnittstelle am SMBus. NVIDIAs Product Brief zur H200 NVL, PB-12128-001_v01 vom 11. April 2025, nennt die SMBus-Adressen 0x9E für Schreib- und 0x9F für Lesezugriffe, „SMBus direct access Supported“ und „SMBPBI (SMBus Post-Box Interface) Supported“. Von den NVIDIA-Briefs, die wir gelesen haben, nennt nur der zur RTX PRO 6000 Server Edition einen SMBPBI-Befehl, die Anforderung, die gesamte Leistungsgrenze der GPU zu setzen. Keiner nennt die Telemetriewerte, die SMBPBI zurückgibt; welche Werte die BMC-Firmware ausliest und wie sie sie darstellt, entscheidet also jeder Serverhersteller selbst.

An der Leistungsgrenze zeigt sich der Unterschied zwischen beiden Pfaden. Im Product Brief zur H200 NVL bleibt eine out-of-band über SMBPBI gesetzte Grenze „über das Laden des Treibers und Systemstarts hinweg in Kraft“, während eine in-band mit nvidia-smi gesetzte „nach jedem neuen Laden des Treibers neu festgelegt werden muss“. NVIDIA spezifiziert die H200 NVL mit mindestens 200 W und höchstens 600 W, dem Standardwert. Bei vier H200 NVL an einer begrenzten Rack-Zuleitung übersteht eine über den BMC gesetzte Grenze Treiber-Updates, während eine Grenze per nvidia-smi einen Dienst braucht, der sie bei jedem Systemstart setzt.

Der Product Brief zur L4, PB-11316-001_v01 vom 9. März 2023, nennt SMBus direct access und SMBPBI als unterstützt. Der Product Brief zur RTX PRO 6000 Server Edition, SP-12355-001_v02 vom 27. Juni 2025, nennt SMBPBI als unterstützt und sagt, die Karte „unterstützt GPU-Out-of-Band-Telemetrie und Firmware-Updates über SMBus und USB 2.0“. Er wiederholt die Formulierung zur Leistungsgrenze aus dem Brief der H200 NVL, mit einem Minimum von 300 W. Prüfen Sie für die L40S deren eigenen Brief und für jede Karte die Liste der unterstützten GPUs des Serverherstellers, bevor Sie sich auf BMC-Werte verlassen.

GPU-Daten in Redfish: Processor, EnvironmentMetrics und ProcessorMetrics

Redfish ist die REST-Schnittstelle der DMTF für das Servermanagement, und ihr Schema-Bundle 2026.2 erschien am 14. September 2026. Eine GPU erscheint als Processor-Ressource, deren ProcessorType den Wert GPU hat; das Schema bietet auch Accelerator an. Der Processor trägt Status, „den Status und Zustand der Ressource“, Throttled und ThrottleCauses sowie eine Speicherzusammenfassung mit ECCModeEnabled. Er verweist auf zwei Metrik-Ressourcen.

EnvironmentMetrics, „die Umgebungsmetriken eines Geräts“, enthält TemperatureCelsius, PowerWatts, PowerLimitWatts und EnergykWh. ProcessorMetrics, „Nutzungs- und Zustandsstatistiken eines Prozessors“, enthält BandwidthPercent, OperatingSpeedMHz, korrigierbare und nicht korrigierbare Fehlerzähler, PCIe-Fehler sowie PowerLimitThrottleDuration und ThermalLimitThrottleDuration, die Zeit, die seit dem letzten Reset gedrosselt wurde. Welche dieser Eigenschaften die BMC-Firmware füllt, entscheidet sie selbst; lesen Sie also die Processor-Ressourcen eines gelieferten Servers, bevor Sie Alarmregeln schreiben.

METRIKOUT-OF-BAND, BMCIN-BAND, TREIBER
GPU-TemperaturRedfish TemperatureCelsius; Dell PrimaryTemperature und MemoryTemperaturenvidia-smi, DCGM-Temperatur­felder
Leistungs­aufnahmeRedfish PowerWatts; Dell PowerConsumption; Lenovo-Sensor GPU{N}_Powernvidia-smi, DCGM-Leistungs­feld
Leistungs­grenzeSMBPBI bei H200 NVL und RTX PRO 6000 Server Edition, bleibt über das Laden des Treibers erhalten; Lenovo GPU{N}_PowerLimitnvidia-smi, nach jedem Laden des Treibers neu zu setzen
DrosselungRedfish ThrottleCauses und Drosselungs­dauern; Dell-Bits für Clock Event Reasonsnvidia-smi Clock Event Reasons, DCGM-Zähler für Grenzwert­verletzungen
Auslastung, SM-AktivitätRedfish BandwidthPercent (Bandbreiten­nutzung); Dell GPUUsage und GPUSMActivityDCGM-Profiling-Felder
Speicher­fehlerZähler aus Dells GPU Statistics, erfasst alle 600 snvidia-smi ECC und Row Remapper, DCGM-ECC-Felder
NVLinkDell-Bits für Link-Status und Laufzeit­fehlernvidia-smi nvlink, DCGM-NVLink-Zähler
Xid-Fehlerkeine in den BMC-Dokumenten, die wir gelesen habenKernel-Log, DCGM, dcgm-exporter
Inventar, FirmwareSupermicro-Reiter GPU mit Modell, Seriennummer, Teilenummer und Firmwarenvidia-smi -q mit VBIOS-Version

Redfish-Schemas Processor v1_24_0, EnvironmentMetrics v1_7_0 und ProcessorMetrics v1_7_0 (DMTF); Dell iDRAC Telemetry Reference Guide; Lenovo XCC2 REST API; Supermicro-BMC-Handbuch X14/H14 Rev. 1.1; NVIDIA Product Briefs zur H200 NVL und zur RTX PRO 6000 Server Edition; Dokumentation zu NVIDIA DCGM 4.6 und zu Xid, alle abgerufen am 10. Oktober 2026.

Was Dell, HPE, Lenovo und Supermicro für GPUs dokumentieren

Die vier Hersteller dokumentieren für PCIe-GPUs sehr unterschiedlich viel. Die Tabelle nennt nur, was das jeweilige Dokument angibt; eine Eigenschaft, die darin fehlt, kann es auf Ihrem Modell und Ihrer Firmware trotzdem geben.

HERSTELLER, BMCDOKUMENTIERTE DATENGENANNTE BEDINGUNGEN
Dell iDRAC9 und iDRAC10Telemetrie­berichte GPU Metrics (40 Metriken, meist alle 5 s) und GPU Statistics (16 Fehlerzähler, alle 600 s)iDRAC-Lizenz „Datacenter“; 14. Generation oder neuer; laut README von Dells Tools iDRAC 4.0 oder höher
HPE iLO 6Processors/{id}/EnvironmentMetrics und ProcessorMetrics hinzugefügt in v1.61; PowerWatts in v1.68; Leistungs­grenze per PATCH in v1.75Changelog sagt nicht, welche GPU-Modelle sie füllen
Lenovo XCC2Controls/GPU{N}_PowerLimit mit dem Sensor GPU{N}_Power, verknüpft mit der Processor-Ressource der GPUSetzen der Grenze erfordert die Lizenz XCC2 Platinum; auf AMD-basierten Systemen nur NVIDIA-GPUs
Supermicro X14/H14 BMCComponent Information, Reiter GPU: Hersteller und Modell, Seriennummer, Teilenummer, Firmware-VersionFunktions­tabelle nennt „GPU monitoring (NVIDIA GPUs)“

Dell iDRAC Telemetry Reference Guide (GPU Metrics, GPU Statistics) und README zu Dells iDRAC-Telemetry-Reference-Tools; HPE-iLO-6-Redfish-Changelog bis v1.79; Lenovo XCC2 REST API, GET GPU PowerLimit properties; Supermicro-BMC-Handbuch X14/H14, Revision 1.1, 22. Dezember 2025. Abgerufen am 10. Oktober 2026.

Dells Referenz nennt weit mehr GPU-Werte als die Dokumente der anderen drei. Sein Bericht GPU Metrics enthält GPUResetRecommendedState, beschrieben als „Ein Flag, das anzeigt, ob ein GPU-Reset empfohlen wird“, PowerBrakeState, ThermalAlertState, Zähler für korrigierbare PCIe-Fehler und NVLink-Fehlerbits je Link. GPU Statistics zählt Einzelbit- und Doppelbitfehler je Speicherbereich und die deswegen stillgelegten Speicherseiten. Telemetrie, gestreamt oder abgefragt, braucht die iDRAC-Lizenz „Datacenter“; nehmen Sie sie also in die Bestellung auf. Dells Leitfaden sagt nicht, wie iDRAC diese Werte erfasst.

Lenovos XCC2 dokumentiert die GPU-Leistung als Redfish-Control: GPU{N}_PowerLimit liest den Sensor GPU{N}_Power und nimmt einen Sollwert in Watt an, ohne die Platinum-Lizenz ausgeblendet. Der Changelog von HPEs iLO 6 fügt in v1.61 EnvironmentMetrics und ProcessorMetrics für Prozessoren hinzu. Seine Einträge zu GPUs nennen einen NVLink-Status zwischen CPU und GPU und die Werte GPU1 und GPU2 in zwei Leistungsschemas, aber keine GPU-Modelle; fragen Sie HPE also bei einer PCIe-Karte, welche Eigenschaften Ihr Modell füllt. Supermicros Handbuch zu X14/H14 dokumentiert einen Inventar-Reiter für GPUs mit Firmware-Versionen, nützlich, wenn ein Update nur einen Teil der Karten erreicht.

Wir bauen KI-Server nach Auftrag mit Out-of-Band-Management über IPMI und den BMC. Nennen Sie uns den bevorzugten Serverhersteller und das Monitoring-System, das den BMC auslesen soll.

Xid-Fehler, ECC-Details und NVLink: der In-Band-Pfad

NVIDIA definiert die Xid-Meldung in seiner Xid-Dokumentation, aktualisiert am 9. September 2026, als „einen Fehlerbericht des NVIDIA-Treibers, der in das Kernel-Log oder Ereignisprotokoll des Betriebssystems geschrieben wird“. Einen Xid gibt es nur dort, wo der Treiber läuft; er gelangt also über das Kernel-Log oder DCGM ins Monitoring-System. DCGM selbst arbeitet über NVML, die Managementbibliothek des Treibers: Seine Dokumentation zu 4.6 beschreibt, wie dcgmDetachDriver „NVML von DCGM trennt“. Stoppt der Treiber, stoppt auch der In-Band-Pfad.

In-band liefern nvidia-smi und DCGM die vollen Details hinter einem GPU-Reset, einem geleerten Knoten oder einem Garantiefall: Xid-Codes, flüchtige und aggregierte ECC-Zählerstände, Row Remapping, Clock Event Reasons je Abtastung sowie NVLink-Replay- und CRC-Zähler. Dells Telemetrie meldet einen Teil davon out-of-band, mit Zählern für Einzelbit- und Doppelbitfehler alle 600 Sekunden, Bits für Clock Event Reasons und NVLink-Fehlerbits, aber keines der BMC-Dokumente, die wir gelesen haben, nennt Row Remapping oder Xid-Codes. Unser Leitfaden zu DCGM-Metriken und XID-Fehlern behandelt die Felder und die Standardwerte von dcgm-exporter, und die Referenz der NVIDIA-Xid-Fehlercodes listet die Codes mit NVIDIAs Maßnahmen. Für eine Karte, die der Treiber nicht mehr erreicht, lesen Sie unseren Artikel zu Xid 79, einer GPU, die vom Bus gefallen ist, und bewahren Sie die BMC-Werte für diesen Steckplatz als zweiten Nachweis für den Garantiefall auf.

Die beiden Pfade unterscheiden sich auch darin, was während einer Wartung weiterläuft. Ein Treiber-Update entlädt das Modul, und dcgm-exporter meldet nichts, bis es wieder geladen ist. Der BMC läuft weiter, aber keines der Dokumente oben sagt, welche GPU-Werte er ohne Treiber noch ausliest; prüfen Sie das also beim ersten Treiber-Update. Inferenz-Latenz, Warteschlangenlänge und KV-Cache-Nutzung liegen noch eine Ebene höher, in der Serving-Engine, wie unser Leitfaden zum LLM-Monitoring erklärt.

BMC-Alarme an das Monitoring-System weiterleiten

Redfish bietet zwei Wege, Daten aus dem BMC zu holen, ohne jede Ressource abzufragen. Der EventService „enthält Eigenschaften zur Verwaltung von Ereignisabonnements und erzeugt die Ereignisse, die an Abonnenten gesendet werden“; jedes Abonnement ist ein Ereignisziel, und der Dienst kann auch einen Server-Sent-Events-Stream und die Zustellung per SMTP anbieten. Der TelemetryService „dient dem Erfassen und Melden von Metrikdaten innerhalb des Redfish-Dienstes“, mit Definitionen von Metrikberichten und Metrikberichten; Dells GPU Metrics und GPU Statistics sind solche Berichte. Ältere Schnittstellen bleiben bestehen, und Supermicros Handbuch zu X14/H14 führt Alarme, SNMP, Syslog und SMTP unter seinen Benachrichtigungseinstellungen.

Für wenige Server genügt ein Collector je Standort, der die Ereignisse jedes BMC abonniert und die Ressourcen für GPU-Temperatur und Leistungsaufnahme abfragt. Versehen Sie jede Zeitreihe mit Server, Steckplatz und Seriennummer der Karte, damit ein BMC-Alarm und ein DCGM-Alarm zur selben Karte in einem Vorfall zusammenlaufen. Der BMC gehört in ein isoliertes Verwaltungsnetz, das nur der Collector und ein Jump-Host erreichen; unser Leitfaden zum Absichern eines GPU-Servers behandelt dieses Netz und die BMC-Firmware.

Beide Pfade auf 2 bis 4 GPU-Servern einrichten

Als Beispiel dienen drei Server mit je acht Karten der RTX PRO 6000 Server Edition und einer mit vier H200 NVL, zusammen 28 GPUs. Wären das Dell-Modelle mit der Lizenz „Datacenter“, würde allein der Bericht GPU Metrics nach unserer Rechnung 40 Werte je GPU liefern, 1.120 für den Standort, die meisten davon alle 5 Sekunden. Die folgende Reihenfolge richtet beide Pfade ein und prüft, was jeder meldet.

  1. Schließen Sie jeden BMC an das Verwaltungsnetz an, aktualisieren Sie seine Firmware auf das aktuelle Release des Herstellers und gleichen Sie das angezeigte GPU-Inventar mit nvidia-smi -q ab.
  2. Lesen Sie auf einem Server die Processor-Ressourcen vom Typ GPU und notieren Sie, welche Eigenschaften von EnvironmentMetrics und ProcessorMetrics er füllt.
  3. Lassen Sie den Collector die Redfish-Ereignisse jedes BMC abonnieren, oder richten Sie SNMP oder Syslog ein, wo Redfish-Ereignisse nicht verfügbar sind.
  4. Fragen Sie GPU-Temperatur und Leistungsaufnahme out-of-band ab und setzen Sie die Schwellwerte nach der Slowdown-Temperatur und der Leistungsgrenze jeder Karte.
  5. Installieren Sie dcgm-exporter in-band, leiten Sie das Kernel-Log für Xid-Zeilen weiter und ergänzen Sie die Felder für ECC, Row Remapping und NVLink, die Ihre Karten unterstützen.
  6. Entladen Sie in einem Wartungsfenster auf einem Server den NVIDIA-Treiber, notieren Sie, welche GPU-Werte der BMC noch meldet, und prüfen Sie, dass ein Test-Temperaturalarm von ihm ankommt; laden Sie dann den Treiber und prüfen Sie, dass auch ein In-Band-Testalarm ankommt.
  7. Halten Sie schriftlich fest, welcher Pfad für welchen Alarm zuständig ist, damit jeder, der einen Alarm bearbeitet, weiß, wo er zuerst nachsehen muss.

Unsere KI-Server werden vor dem Versand montiert und im Burn-in getestet, mit Testbericht auf Wunsch. Schicken Sie uns die geplanten Karten und die Zahl der Server über das Formular unten, und wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot.

Was wir liefern

Wir bauen KI-Server nach Auftrag mit Out-of-Band-Management über IPMI und den BMC, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente, unter einem EU-Vertrag und auf einer Rechnung. Die Karten in diesem Artikel stammen aus unserem GPU-Sortiment: die H200 NVL mit NVLink-Brücken, die RTX PRO 6000 Server Edition, die L40S und die L4. Betriebssystem, Treiber, CUDA und eine Container-Runtime installieren wir auf Wunsch, und den Support für die Karten übernimmt das Serviceteam unseres Engineering-Partners. Wenn Ihr Monitoring eine BMC-Funktion nutzt, die eine Lizenz braucht, etwa Dells iDRAC-Lizenz „Datacenter“ für die Telemetrie, nennen Sie sie in Ihrer Anfrage.

FAQ

Was ist GPU Out-of-Band Monitoring?
Es liest die GPUs über den Baseboard Management Controller des Servers an dessen eigenem Management-Port aus statt über das Betriebssystem. Bei Rechenzentrumskarten erreicht der BMC die GPU über den SMBus, über NVIDIAs SMBus Post-Box Interface, wo der Serverhersteller es implementiert, und stellt Temperatur, Leistungsaufnahme der Karte und Zustand über Redfish und seine Webkonsole bereit. Xid-Fehler und Row Remapping bleiben in-band, im Treiber und in DCGM, während manche BMCs, darunter Dells iDRAC, auch ECC-Zähler, Clock Event Reasons und NVLink-Fehlerflags melden.
Kann der BMC die GPU-Temperatur überwachen?
Ja, auf Servern, deren BMC-Firmware das eingebaute GPU-Modell unterstützt; laut NVIDIAs Product Brief zur RTX PRO 6000 Server Edition meldet diese Karte ihre Temperaturwerte über In-Band- und Out-of-Band-Managementpfade. Redfish beschreibt die GPU-Temperatur als TemperatureCelsius in den EnvironmentMetrics der Processor-Ressource der GPU, und Dells iDRAC-Telemetrie führt für GPUs Primär-, Speicher- und Board-Temperaturen. Prüfen Sie die Liste der unterstützten GPUs des Serverherstellers und lesen Sie die Werte auf einem gelieferten Server, bevor Sie Schwellwerte setzen.
Welche GPU-Telemetrie liefert Redfish?
Redfish 2026.2 bildet eine GPU als Processor vom Typ GPU ab, mit Status, Drosselungszustand und Drosselungsursachen sowie einer Speicherzusammenfassung mit ECC-Modus. Seine EnvironmentMetrics enthalten Temperatur, Leistungsaufnahme, Leistungsgrenze und Energie, seine ProcessorMetrics Bandbreitennutzung, Betriebstakt, Fehlerzähler und Drosselungsdauern. Das Schema definiert diese Eigenschaften, und jeder BMC entscheidet, welche davon er füllt.
Überwacht iDRAC NVIDIA-GPUs?
Dells iDRAC Telemetry Reference Guide, der iDRAC9 und iDRAC10 abdeckt, führt einen Bericht GPU Metrics mit 40 Metriken, darunter Temperaturen, Leistungsaufnahme der Karte, Leistungsgrenzen, Clock Event Reasons, SM-Aktivität, PCIe- und NVLink-Fehler, und einen Bericht GPU Statistics mit 16 Speicherfehlerzählern. Die Telemetrie erfordert eine iDRAC-Lizenz „Datacenter“ und einen Server der 14. Generation oder neuer.
Was ist NVIDIA SMBPBI?
SMBPBI ist NVIDIAs SMBus Post-Box Interface auf Rechenzentrums-GPUs, über das der BMC eines Servers mit der Karte über den SMBus kommuniziert, ohne den Weg über das Betriebssystem. NVIDIAs Product Briefs zur H200 NVL, L4 und RTX PRO 6000 Server Edition führen es als unterstützt, und die Briefs zur H200 NVL und zur RTX PRO 6000 Server Edition sagen, dass eine über SMBPBI gesetzte Leistungsgrenze über das Laden des Treibers und Systemstarts hinweg in Kraft bleibt. Die Briefs nennen nicht die Telemetriewerte, die es zurückgibt; welche Werte angezeigt werden, hängt also von der BMC-Firmware des Serverherstellers ab.
Sind NVIDIA-Xid-Fehler out-of-band sichtbar?
Nicht in den BMC-Dokumenten von Dell, HPE, Lenovo und Supermicro, die wir im Oktober 2026 gelesen haben. NVIDIA definiert einen Xid als Fehlerbericht des Treibers, der in das Kernel-Log oder Ereignisprotokoll des Betriebssystems geschrieben wird; er wird also in-band aus diesem Log oder über DCGM erfasst. Dells iDRAC bietet out-of-band allerdings je GPU ein Flag für einen empfohlenen Reset, das den Xid-Alarm ergänzen kann.

Schicken Sie uns die geplante Zahl der GPU-Server und Karten, den bevorzugten Serverhersteller und das Monitoring-System, das BMC-Ereignisse und DCGM-Metriken empfangen soll. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien