BLOG · VERGLEICH ·

A100-PCIe-Karten ersetzen: RTX PRO 6000 Server Edition oder H200 NVL und was sich bei Strom, Kühlung, Software und MIG ändert

IN KÜRZE
  • Eine A100 PCIe ist eine Karte mit 250 W (40 GB) oder 300 W (80 GB) und einem 8-poligen CPU-Anschluss; die H200 NVL und die RTX PRO 6000 Server Edition laufen mit bis zu 600 W an einem 16-poligen Kabel, dessen Sense-Pins genug Leistung melden müssen, sonst startet die Karte nicht
  • Ampere hat keine FP8-Tensor-Kerne: vLLM führt FP8-Checkpoints auf einer A100 als W8A16 mit nur quantisierten Gewichten (Weight-only) aus, während die H200 NVL in FP8 rechnet und die RTX PRO 6000 in FP8 und FP4
  • Für FP64-Arbeit ist die H200 NVL die Nachfolgerin, mit 30 TFLOPS gegenüber 9,7 bei der A100; die RTX PRO 6000 rechnet FP64 mit 1/64 ihrer FP32-Rate, nach unserer Rechnung etwa 1,9 TFLOPS
  • MIG bleibt auf der H200 NVL bei sieben Instanzen zu je 16,5 GB und sinkt auf der RTX PRO 6000 auf vier zu 24 GB; ab Hopper übersteht der MIG-Modus keinen Neustart mehr, wie er es auf der A100 tat
  • In NVIDIAs Release Notes deckt der Treiberzweig R570 die A100 und die H200 NVL ab, aber nicht die RTX PRO 6000 Server Edition, deren Product Brief R575 oder neuer und CUDA 12.9 oder neuer verlangt; die Release Notes von R580 und R595 vom August 2026 führen alle drei auf

Was Sie ersetzen

Die A100 PCIe gab es in zwei Versionen: 40 GB HBM2 mit 1.555 GB/s und 250 W sowie 80 GB HBM2e mit 1.935 GB/s und 300 W. Beide sind passiv gekühlte Dual-Slot-Karten in voller Länge mit PCIe 4.0 x16, die sich über NVLink-Brücken mit 600 GB/s paarweise verbinden lassen; die 80-GB-Karte gab es außerdem in einer flüssigkeitsgekühlten Single-Slot-Version. NVIDIA unterstützt sie in der Software weiterhin: Seine Seite zum vGPU-Lebenszyklus, aktualisiert am 4. August 2026, führt die A100 PCIe und die A100 PCIe 80GB unter den GPUs auf, die „das Ende der vollen Supportphase nicht erreicht haben“, und CUDA 13.0 hat Maxwell, Pascal und Volta gestrichen, nicht Ampere. Die Gründe für einen Austausch sind Speicher, Zahlenformate und Bandbreite. Die beiden PCIe-Karten, die diese Rolle übernehmen, sind die H200 NVL und die RTX PRO 6000 Blackwell Server Edition, und sie unterscheiden sich voneinander ebenso stark wie von der A100.

Die vier Karten nebeneinander

SPEZIFIKATIONA100 40GB PCIEA100 80GB PCIEH200 NVLRTX PRO 6000 SE
ArchitekturAmpere, CC 8.0Ampere, CC 8.0Hopper, CC 9.0Blackwell, CC 12.0
Speicher40 GB HBM280 GB HBM2e141 GB HBM3e96 GB GDDR7
Bandbreite1.555 GB/s1.935 GB/s4.800 GB/s1.597 GB/s
Leistungsaufnahme250 W300 Wbis zu 600 Wbis zu 600 W
Stromanschluss8-polig (CPU)8-polig (CPU)16-polig (PCIe)16-polig (PCIe)
Host-AnbindungPCIe 4.0 x16PCIe 4.0 x16Gen5 x16, Gen5 x8, Gen4 x16Gen5 x16, Gen5 x8, Gen4 x16
NVLink2 Karten, 600 GB/s2 Karten, 600 GB/s2 oder 4 Karten, 900 GB/s je GPUkeins
MIG7 × 5 GB7 × 10 GB7 × 16,5 GB4 × 24 GB
FP64, Vektor und Tensor9,7 und 19,5 TFLOPS9,7 und 19,5 TFLOPS30 und 60 TFLOPSetwa 1,9 TFLOPS, Vektor
BF16 Tensor, dicht312 TFLOPS312 TFLOPSetwa 836 TFLOPSetwa 480 TFLOPS
FP8 und FP4 Tensorkeins von beidenkeins von beidenFP8FP8 und FP4
Video-Enginesnur Decodernur Decoder7 NVDEC, 7 JPEG4 NVENC, 4 NVDEC, 4 JPEG

NVIDIA-Datenblatt zur A100 (Juni 2021) und Product Briefs PB-10137 (2020) und PB-10577 (2022); Produktseite zur H200 und Product Brief PB-12128 zur H200 NVL (April 2025); Produktseite der RTX PRO 6000 Server Edition, Datenblatt (Dezember 2025), Product Brief SP-12355 (Juni 2025) und Whitepaper zur Architektur von RTX PRO Blackwell; MIG-Leitfaden (September 2026). CC steht für die CUDA Compute Capability, SE für die Server Edition. Die dichten H200-Werte sind NVIDIAs Sparsity-Werte, halbiert. Die BF16- und FP64-Werte der RTX PRO 6000 sind unsere Rechnung aus dem Whitepaper, dichtes BF16 mit dem Vierfachen und FP64 mit 1/64 der 120 TFLOPS FP32 der Server Edition; bei NVIDIAs prominent genanntem Wert von 1 PFLOP BF16 für die Karte fehlt die Angabe, ob Sparsity eingerechnet ist.

Lesen Sie zuerst die Zeilen zu Leistung, Anschluss und Host-Anbindung: Sie entscheiden, ob ein bestimmter Server überhaupt eine der beiden Karten aufnehmen kann. Die Zeilen zu Speicher und Formaten entscheiden, was die Karte ausführen wird, und die Zeilen zu FP64, NVLink und MIG entscheiden, welche A100-Aufgaben nur auf eine der beiden umziehen können.

Formate: was FP8 und FP4 beim Serving ändern

Das Datenblatt der A100 führt Raten der Tensor-Kerne für FP64, TF32, BF16, FP16 und INT8 auf und keine für FP8. Die Dokumentation von vLLM stellt fest, dass FP8-Berechnungen Compute Capability 8.9 oder höher brauchen und dass FP8-Modelle auf älteren GPUs „als Weight-only W8A16 unter Verwendung von FP8 Marlin“ laufen: Auf einer A100 halbiert ein FP8-Checkpoint die Gewichte, die Arithmetik bleibt aber bei 16 Bit. Die Support-Matrix von TensorRT-LLM vom 21. September 2026 nennt für Ampere INT4 AWQ und GPTQ mit 16-Bit-Aktivierungen sowie einen FP8-KV-Cache und keine FP8- oder FP4-Arithmetik. Hopper ergänzt FP8 mit Skalierung pro Tensor, pro Block und pro Zeile sowie INT4 mit FP8-Aktivierungen. Die Generation der RTX PRO 6000 ergänzt NVFP4 und MXFP4, während dieselbe Matrix für sie nur FP8 mit Skalierung pro Tensor und weder AWQ noch GPTQ aufführt.

Die Speicherrechnung für Llama 3.3 70B, mit einer Planungsregel von 90 Prozent des vom Treiber gemeldeten Speichers minus die Gewichte: In FP8 hat das Modell 68 GiB. Auf einer A100 80 GB bleiben damit etwa 4 GiB, und das Modell läuft nur mit quantisierten Gewichten (Weight-only); in BF16 braucht es mit etwa 131 GiB zwei Karten A100 80 GB. Auf der H200 NVL mit 140,4 GiB sichtbarem Speicher bleiben 58,4 GiB, Cache für etwa 46 Gespräche mit 8.192 Token in FP8. Auf der RTX PRO 6000 mit 95,6 GiB sichtbarem Speicher bleiben 18 GiB, etwa 14 Gespräche, oder 46 GiB und etwa 36 Gespräche mit dem NVFP4-Checkpoint von 40 GiB.

Für einen einzelnen Nutzer folgt die Generierung der Bandbreite, und hier ist die RTX PRO 6000 kein Fortschritt: 1.597 GB/s gegenüber 1.935 bei der A100 80 GB. Ihre Vorteile sind FP4-Gewichte, die die je Token gelesenen Bytes gegenüber FP8 um etwa 40 Prozent senken (40 gegenüber 68 GiB bei Llama 3.3 70B), native FP8- und FP4-Arithmetik für die rechenlimitierte Prefill-Phase und 16 GB mehr Speicher. Die H200 NVL ist mit 4.800 GB/s das Upgrade bei der Bandbreite; unser Inferenzvergleich stellt die beiden einander gegenüber.

Bei doppelter Genauigkeit gehen sie noch weiter auseinander. Die H200 NVL liefert 30 TFLOPS in FP64 und 60 auf ihren Tensor-Kernen, das Dreifache der 9,7 und 19,5 der A100. NVIDIAs Whitepaper zu RTX PRO Blackwell sagt, dass der Chip GB202 zwei FP64-Kerne je SM hat, FP64 mit 1/64 seiner FP32-Rate ausführt und diese Kerne enthält, „um sicherzustellen, dass alle Programme mit FP-64-Code korrekt arbeiten“. Damit liegt die Server Edition nach unserer Rechnung bei etwa 1,9 TFLOPS, einem Fünftel einer A100. Simulationscodes, die auf A100-Karten in doppelter Genauigkeit liefen, gehören auf die H200 NVL.

MIG und vGPU

Beide A100-Versionen und die H200 NVL lassen sich in bis zu sieben Instanzen teilen, 1g.5gb oder 1g.10gb auf der A100 und 1g.18gb auf der H200 NVL, die NVIDIA mit je 16,5 GB angibt; die RTX PRO 6000 lässt sich in vier zu 24 GB teilen, mit +gfx-Profilen, die Grafik innerhalb einer Instanz ausführen. Zwei Details im Betrieb ändern sich mit der Generation. Auf Ampere versucht der Treiber beim Aktivieren von MIG einen GPU-Reset, und der MIG-Modus wird im InfoROM gespeichert und übersteht einen Neustart. Ab Hopper ist kein Reset nötig, aber der MIG-Modus besteht nur, solange der Treiber geladen ist. Die Instanzen selbst müssen auf jeder Karte nach einem Neustart neu angelegt werden, wofür NVIDIA auf sein Werkzeug mig-parted verweist, ausgeführt als systemd-Dienst. Für A100 geschriebene Boot-Automatisierung braucht auf den neuen Karten einen Schritt für den MIG-Modus.

Bei virtuellen Maschinen liegt der Unterschied darin, was die Partitionen tun dürfen. Die A100 und die H200 NVL unterstützen nur Compute-vGPU-Profile (C-Serie), lizenziert über NVIDIA AI Enterprise: ab A100-1-5C auf der 40-GB-Karte und A100D-1-10C auf der 80-GB-Karte aufwärts sowie sieben Instanzen H200-1-18C oder bis zu 32 per Time-Slicing geteilte Profile mit 4 GB auf der H200 NVL. Die RTX PRO 6000 Server Edition steht seit Release 19.0 auf NVIDIAs vGPU-Liste, mit Profilen für virtuelle Workstations und Desktops ebenso wie mit Compute-Profilen. Von den beiden Ersatzkarten kommt die H200 NVL mit einem fünfjährigen Abonnement von NVIDIA AI Enterprise; für die RTX PRO 6000 Server Edition haben wir keine solche Beigabe gefunden.

Strom, Kühlung und das Kabel

Die Leistung je Steckplatz verdoppelt sich mindestens: Aus 250 oder 300 W werden bis zu 600 W, und bei vier Karten steigt die Leistung von 1,0 oder 1,2 kW auf 2,4 kW, bevor Prozessoren und Lüfter hinzukommen. Auch der Anschluss ändert sich. Die A100 PCIe nutzt einen 8-poligen CPU-Zusatzanschluss; beide Ersatzkarten nutzen einen 16-poligen PCIe-Anschluss, dessen Sense-Pins der Karte mitteilen, was die Stromversorgung liefern kann. Die Product Briefs beider Karten sagen: Liegt der signalisierte Pegel „unter der voreingestellten Leistungsgrenze der NVIDIA-Karte, startet die Karte nicht.“ Die H200 NVL unterstützt nur die Stufe 451 bis 600 W. Die RTX PRO 6000 Server Edition akzeptiert auch 301 bis 450 W und begrenzt sich dann selbst auf 450 W; Lenovo zum Beispiel nennt vier dieser Karten in einem SR650a V4, wenn sie auf 450 W begrenzt sind, gegenüber zwei mit 600 W.

Es folgen Luftstrom und Steckplatz. Der Product Brief der RTX PRO 6000 verlangt mindestens 43 CFM über einen Luftkanal geführte Luft durch den Kühlkörper bei 25 °C Einlasstemperatur, 65 CFM bei 35 °C und 125 CFM bei 45 °C; der Product Brief der H200 NVL nennt keinen Wert. Beide Briefs lassen eine Host-Anbindung mit Gen5 x16, Gen5 x8 oder Gen4 x16 zu, ein Server mit PCIe 4.0 schließt also keine der beiden Karten aus, auch wenn eine Anbindung mit Gen4 x16 die Bandbreite zum Host halbiert.

Nichts davon entscheidet die Karte allein. Es entscheidet die GPU-Supportliste des Serverherstellers für Ihren genauen Maschinentyp. Dells PowerEdge-GPU-Matrix vom August 2026 listet beide Karten nur für Server der siebzehnten Generation und die A100 überhaupt nicht. Unsere Checkliste zur H200 NVL geht den Rest durch: Kabelteilenummern je Steckplatz, Lüftersätze, Luftkanäle, Laufwerks-Backplanes und Netzteile.

Treiber, CUDA und Container

Die Untergrenze bei der Software steigt. NVIDIAs Product Brief zur H200 NVL verlangt Treiber R565 TRD1 oder neuer und CUDA 12.7, eine Version, die NVIDIAs Toolkit-Archiv nicht aufführt, in der Praxis also Version 12.8 oder neuer; der Product Brief der RTX PRO 6000 Server Edition verlangt R575 oder neuer und auf x86 CUDA 12.9 oder neuer. In NVIDIAs Release Notes zum Rechenzentrumstreiber führt der Zweig R570 die A100 und die H200 NVL auf, aber nicht die Server Edition, die erst in R575 auftaucht. Das Release R580 vom 3. August 2026 führt die A100, die A100 80GB PCIe, die H200 NVL und die RTX PRO 6000 Server Edition auf, ebenso das Release R595 vom selben Tag; ein einziger Treiber kann also einen Server in der Übergangsphase betreiben. In NVIDIAs Tabelle der unterstützten Zweige vom 9. September 2026 ist R580 ein Long Term Support Branch mit Support bis Juni 2028 und R595 der Production Branch mit Support bis März 2027. Auch die Release Notes von R615, einem New Feature Branch, der in dieser Tabelle nicht steht, nennen alle drei Karten. Die Images müssen ebenfalls die neuen Chips berücksichtigen: CUDA 12.8 war das erste Toolkit mit Compiler-Unterstützung für Blackwells SM_120, und PyTorch hat die Unterstützung für Blackwell mit Builds für CUDA 12.8 in Version 2.7 ergänzt. Ein für die A100 auf Basis von CUDA 11 gebauter Container liegt unter den CUDA-Versionen, die beide Briefs verlangen, und enthält keinen kompilierten Code für Blackwell. Unser Leitfaden zu Treibern und CUDA behandelt die Wahl des Zweigs und die Kompatibilität von Containern.

Welche Karte welche A100-Aufgabe übernimmt

Simulation in doppelter Genauigkeit: die H200 NVL. Die RTX PRO 6000 ist keine FP64-Karte.

Per Brücke verbundene Paare, die ein Modell über zwei Karten betreiben: die H200 NVL, deren Brücke zwei oder vier Karten mit 900 GB/s je GPU verbindet. Sie nutzt eine Brücke je Karte, wo das A100-Paar drei nutzte, der alte Satz lässt sich also nicht übernehmen, und die RTX PRO 6000 hat überhaupt kein NVLink.

Interaktives Serving mit langen Kontexten: die H200 NVL, mit 141 GB bei 4.800 GB/s.

Durchsatz-Serving von Modellen, die in 96 GB passen, neben Grafik, Video oder virtuellen Desktops: die RTX PRO 6000 Server Edition, die Karte, die NVIDIA auch der L40S gegenüberstellt.

Isolierte Mandanten: sieben je Karte auf der H200 NVL; vier auf der RTX PRO 6000, mit Grafik innerhalb der Instanzen.

Ein Server, der 600 W, den Luftstrom oder das Kabel nicht an einen Steckplatz bringt: keine der beiden Karten mit voller Leistung. Die RTX PRO 6000 mit 450 W ist die Ausweichlösung, wo der Hersteller sie listet; andernfalls ist es der Server, der ersetzt werden muss.

Was wir liefern

Eurokommerz liefert die H200 NVL und die RTX PRO 6000 EU-weit mit Herstellergarantie, als Karten oder in Servern, die mit den nötigen Netzteilen, Kabeln und dem nötigen Luftstrom konfiguriert sind. Die A100 liefern wir nicht; schicken Sie uns das Servermodell und die Arbeitslast, und wir prüfen, welchen Ersatz der Hersteller des Servers unterstützt.

FAQ

Passt eine H200 NVL oder RTX PRO 6000 in einen Server, der für A100-PCIe-Karten gebaut wurde?
Nur wenn der Serverhersteller diese Karte für Ihren genauen Maschinentyp listet. Beide brauchen bis zu 600 W je Steckplatz über ein 16-poliges Kabel statt 250 oder 300 W über einen 8-poligen CPU-Anschluss, dazu passenden Luftstrom; Dells GPU-Matrix vom August 2026 listet beide nur für PowerEdge-Server der siebzehnten Generation.
Unterstützt die A100 FP8?
Nein. Ihr Datenblatt führt Raten der Tensor-Kerne für TF32, BF16, FP16, INT8 und FP64 auf und keine für FP8. vLLM führt FP8-Checkpoints auf ihr als W8A16 mit nur quantisierten Gewichten (Weight-only) aus, was Speicher spart, aber in 16 Bit rechnet; FP8-Arithmetik braucht Compute Capability 8.9 oder höher.
Welcher Ersatz eignet sich besser für FP64-Arbeitslasten?
Die H200 NVL, mit 30 TFLOPS in FP64 und 60 auf ihren Tensor-Kernen gegenüber 9,7 und 19,5 auf der A100. Die RTX PRO 6000 rechnet FP64 mit 1/64 ihrer FP32-Rate, nach unserer Rechnung etwa 1,9 TFLOPS.
Wie viele MIG-Instanzen unterstützen die Ersatzkarten?
Die H200 NVL bis zu sieben zu 16,5 GB, wie die sieben der A100; die RTX PRO 6000 Server Edition bis zu vier zu 24 GB, mit Profilen, die auch Grafik ausführen. Ab Hopper muss der MIG-Modus nach jedem Neustart erneut aktiviert werden.
Kann ich die NVLink-Brücken der A100 weiterverwenden?
Nein. Die A100 PCIe verbindet zwei Karten mit drei Brücken und 600 GB/s; die H200 NVL nutzt eine 2-fach- oder 4-fach-Brücke je Karte mit 900 GB/s je GPU, und die RTX PRO 6000 Server Edition hat kein NVLink.
Welcher Treiber betreibt A100, H200 NVL und RTX PRO 6000 in einem Server?
R580 oder R595. Stand September 2026 führt NVIDIAs Tabelle der Zweige R580 als Long Term Support Branch bis Juni 2028 und R595 als Production Branch bis März 2027, und die Release Notes beider Zweige führen, wie die des New Feature Branch R615, die A100, die H200 NVL und die RTX PRO 6000 Server Edition auf. Der Zweig R570 deckt die A100 und die H200 NVL ab, aber nicht die Server Edition.

Nennen Sie uns das Servermodell, wie viele A100-Karten es enthält, ob sie per Brücke verbunden sind und was auf ihnen läuft. Wir sagen Ihnen, welchen Ersatz Server und Arbeitslast zulassen und was sich damit sonst noch ändern muss. Wir antworten innerhalb eines Werktages.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at  ·  +43 1 585 1405 50  ·  Jordangasse 7, 1010 Wien