Ein 8-GPU-Server oder zwei 4-GPU-Server: H200 NVL und RTX PRO 6000 im Vergleich
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- NVIDIA führt für die H200 NVL Zweifach- und Vierfach-NVLink-Brücken und „bis zu vier über NVIDIA NVLink verbundene GPUs“, nach unserer Lesart bilden acht Karten also höchstens zwei NVLink-Domänen zu je vier, in einem Server oder in zwei; die RTX PRO 6000 Server Edition hat kein NVLink
- Ein Hostausfall, ein Neustart oder ein Treiber-Update stoppt alle acht Karten eines Servers, bei zwei Servern aber nur vier; in unserem Beispiel mit 2.000 Mitarbeitern und gpt-oss-120b bei 32K halten zwei H200-NVL-Server mit je vier Karten bei einem ausgefallenen Host 220 Gespräche
- Ein Modell über den 564 GB von vier H200 NVL, etwa DeepSeek-V3.1 in FP8 mit etwa 689 GB, braucht alle acht Karten; in zwei Pipeline-Stufen aufgeteilt, läuft es in einem Server über PCIe und in zwei Servern über das Netzwerk, und in beiden Varianten stoppt es bei jedem Hostausfall
- Acht Karten mit 600 W ziehen allein 4,8 kW und brauchen an einem Rack-Platz eine Drehstrom-Zuleitung; zwei Server mit je vier Karten ziehen für die Karten je 2,4 kW und können in getrennten Racks an getrennten Zuleitungen stehen
- NVIDIA AI Enterprise wird pro GPU lizenziert, acht Karten, auf denen seine Software läuft, brauchen also in beiden Varianten acht Lizenzen; jede H200 NVL enthält ein fünfjähriges Abonnement, die RTX PRO 6000 Server Edition keines; Gehäuse, Netzteile, Management-Controller und Netzwerkports werden doppelt gekauft
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Ein 8-GPU-Server oder zwei 4-GPU-Server: die kurze Antwort
Ein 8-GPU-Server und zwei 4-GPU-Server bieten denselben GPU-Speicher und brauchen gleich viele Lizenzen je GPU. Mit der H200 NVL ergibt sich auch dieselbe NVLink-Anordnung, denn NVIDIAs Brücken verbinden zwei oder vier Karten, und nach unserer Lesart bilden acht Karten in beiden Fällen höchstens zwei NVLink-Domänen zu je vier Karten. Die Entscheidung hängt an den übrigen Unterschieden: wie viele Karten stoppen, wenn ein Host ausfällt oder neu startet, ob ein Modell mehr als vier Karten braucht, welche Leistung und welchen Platz jeder Rack-Platz bietet und welche Gehäuse, Prozessoren und Ports Sie doppelt kaufen.
Zwei Server mit je vier Karten eignen sich für Modelle, die auf vier Karten passen, und für einen Dienst, der einen Hostausfall oder ein Wartungsfenster überstehen muss. Ein Server mit acht Karten eignet sich für ein Modell, das alle acht Karten braucht, für Fine-Tuning über acht Karten oder für einen Standort mit einem einzigen Rack-Platz, der die Last tragen kann.
| KRITERIUM | EIN SERVER, 8 GPUS | ZWEI SERVER, 4 GPUS |
|---|---|---|
| H200 NVL NVLink | zwei 4-fach-Domänen, über PCIe verbunden | eine 4-fach-Domäne je Server |
| Modell über vier Karten | innerhalb eines Hosts aufgeteilt | über das Netzwerk auf zwei Hosts aufgeteilt |
| Hostausfall oder Neustart | alle acht Karten stoppen | vier Karten stoppen, vier bedienen weiter |
| Rack-Platz, Lenovo SR675 V3 | 3U | 2 × 3U |
| Strom für die Karten | 4,8 kW an einem Platz | 2,4 kW je Server, getrennte Zuleitungen möglich |
| NVIDIA AI Enterprise | acht GPU-Lizenzen | acht GPU-Lizenzen |
| Gehäuse, Netzteile, Ports | ein Satz | zwei Sätze |
NVIDIAs Produktseite zur H200 und Lizenzierungsleitfaden für AI Enterprise (2. September 2026), Lenovo Press LP1611 (8. Oktober 2026), alle gelesen am 10. Oktober 2026; Leistung der Karten mit 600 W je Karte, wie NVIDIA und Lenovo sie angeben. Zwei Domänen in einem Server mit acht Karten sind unsere Lesart von NVIDIAs Brückengrenze von vier Karten.
H200 NVL: NVLink-Domänen aus vier Karten in beiden Varianten
NVIDIAs Spezifikation der H200 NVL führt eine „2- or 4-way NVIDIA NVLink bridge: 900GB/s per GPU“ neben „PCIe Gen5: 128GB/s“ sowie Serveroptionen „mit bis zu 8 GPUs“. Ihre Produktseite nennt „bis zu vier über NVIDIA NVLink verbundene GPUs“. Ein NVIDIA-Dokument, das beschreibt, wie die Brücken in einem Server mit acht Karten angeordnet sind, haben wir nicht gefunden. Eine Grenze von vier Karten und acht Karten je Server ergeben höchstens zwei Domänen zu je vier Karten, die über PCIe verbunden sind, oder vier Paare mit Zweifach-Brücken. Unser Leitfaden zur Zahl der H200 NVL für große Modelle dimensioniert zwei Domänen zu je vier Karten. Lenovos ThinkSystem SR675 V3 mit 3U, gelistet für bis zu acht doppelt breite GPUs „mit NVLink-Brücken“, führt seine Konfigurationen mit acht Karten und x16 über einen PCIe-Switch der fünften Generation.
In zwei Servern mit je vier Karten hält jeder Server eine vollständige Domäne, und die Verbindung zwischen den Domänen ist das Netzwerk statt PCIe. Innerhalb einer Domäne teilt Tensor-Parallelismus jede Schicht über NVLink auf. Zwischen den Domänen teilt eine gängige Anordnung das Modell mit Pipeline-Parallelismus in Stufen auf, der nur die Aktivierungen an der Stufengrenze überträgt. Für ein Modell, das auf vier Karten passt, müssen die Domänen nie miteinander kommunizieren, und beide Varianten verhalten sich gleich, bis ein Host ausfällt.
Ausfalldomäne und Wartungsfenster
Ein Host ist die Einheit, die ausfällt, und die Einheit, die Sie warten. Ein defektes Mainboard oder ein defekter Prozessor, ein Firmware-Update, ein Neustart nach einem Kernel- oder Treiber-Update und das Neuladen des GPU-Treibers stoppen jede Karte in diesem Host. Bei einem Server mit acht Karten ist das der ganze Dienst. Bei zwei Servern mit je vier Karten ist es die Hälfte der Karten, und der andere Server bedient weiter, während der erste in seinem Wartungsfenster ist. Eine einzelne defekte Karte trifft beide Varianten zunächst gleich: Replikate auf den anderen Karten laufen weiter, und ein über vier Karten aufgeteiltes Modell verliert diese Kopie. Um eine PCIe-Karte zu tauschen, muss ihr Server ausgeschaltet werden, und dieses Fenster stoppt wieder acht Karten oder vier.
Die nach einem Hostausfall verbleibende Kapazität zeigt den Unterschied. Unser Leitfaden zu privaten ChatGPT-Servern nach Unternehmensgröße schätzt, dass eine RTX PRO 6000 rund 19 Gespräche mit gpt-oss-120b bei deklarierten 32K Kontext und einem 16-Bit-Cache hält und eine H200 NVL rund 55, und sein Beispiel mit 2.000 Mitarbeitern hat eine Spitze von 80 Anfragen in Bearbeitung.
| VARIANTE | ALLE HOSTS AKTIV | EIN HOST AUSGEFALLEN |
|---|---|---|
| 1 × 8 H200 NVL | 440 | 0 |
| 2 × 4 H200 NVL | 440 | 220 |
| 1 × 8 RTX PRO 6000 | 152 | 0 |
| 2 × 4 RTX PRO 6000 | 152 | 76, unter der Spitze von 80 |
Gleichzeitige Gespräche mit gpt-oss-120b bei 32K, eine Kopie je Karte, mit den Schätzungen je Karte aus unserem Leitfaden zur Unternehmensgröße; unsere Rechnung.
Zwei H200-NVL-Server mit je vier Karten halten die Beispielspitze auch mit einem ausgefallenen Host. Zwei RTX-PRO-6000-Server mit je vier Karten verfehlen sie um vier Gespräche, weshalb unser Leitfaden zur Hochverfügbarkeit für LLM-Inferenz mit zwei Knoten für diesen Fall fünf Karten je Knoten ansetzt. Derselbe Leitfaden behandelt Health Checks, Load Balancing und Rolling Updates.
Wir bauen KI-Server auf Bestellung mit 2 bis 8 GPUs pro Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Nennen Sie uns im Formular unten Ihre Modelle und wie lange der Dienst ausfallen darf.
Modelle, die mehr als vier Karten brauchen
Manche Modelle passen nicht in eine Domäne. Nach den Werten in unserem H200-NVL-Leitfaden belegt DeepSeek-V3.1 oder R1 in FP8 etwa 689 GB und Kimi K2 Thinking in INT4 594 GB, beide mehr als die 564 GB von vier H200 NVL. Ein solches Modell braucht alle acht Karten. Unser H200-NVL-Leitfaden dimensioniert es als zwei Pipeline-Stufen zu je vier Karten, eine je NVLink-Domäne; Anordnungen wie Tensor-Parallelismus über alle acht Karten schicken mehr Verkehr zwischen den Domänen.
In einem Server mit acht Karten verläuft die Stufengrenze über PCIe innerhalb des Hosts, und vLLM läuft auf einer Maschine. In zwei Servern mit je vier Karten verläuft sie über das Netzwerk, und vLLM läuft als Multi-Node-Deployment. Seine Dokumentation setzt die Tensor-Parallel-Größe auf die Zahl der GPUs je Knoten und die Pipeline-Parallel-Größe auf die Zahl der Knoten, vermerkt, dass solche Deployments „Ray als Laufzeit-Engine nutzen können“, und verlangt, dass „jeder Knoten eine identische Ausführungsumgebung bereitstellt, einschließlich des Modellpfads und der Python-Pakete“. Sie warnt außerdem: „Effizienter Tensor-Parallelismus erfordert schnelle Kommunikation zwischen den Knoten“, und so bleibt der Tensor-Parallelismus innerhalb jedes Servers. NVIDIAs Konfigurationsleitfaden für NVIDIA-Certified Systems verlangt „mindestens 200 Gbit/s für Multi-Node-Inferenz“, also 25 GB/s, gegenüber 64 GB/s je Richtung bei einem PCIe-5.0-x16-Link.
Die Verfügbarkeit verbessert sich durch die Aufteilung nicht. Das Modell braucht beide Server, also stoppt es beim Ausfall eines der beiden Hosts, genauso wie beim Ausfall des einen Hosts mit acht Karten. Ein Dienst, der mit einem Modell dieser Größe einen Hostausfall überstehen muss, braucht einen zweiten Satz von acht Karten. Für eine Kopie eines solchen Modells ist der einzelne Server mit acht Karten die einfachere Variante, denn er braucht keine Cluster-Laufzeitumgebung und kein schnelles Netzwerk zwischen Servern.
Acht RTX PRO 6000: ein PCIe-Server oder zwei
Die RTX PRO 6000 Blackwell Server Edition hat 96 GB GDDR7 und eine konfigurierbare Leistungsgrenze von bis zu 600 W, und NVIDIAs Spezifikation führt für sie kein NVLink. Ihre Karten tauschen in beiden Varianten Daten über PCIe aus, innerhalb eines Hosts über die PCIe-Switches des Servers und zwischen zwei Hosts über das Netzwerk. In den Beispielen unseres Leitfadens zur Unternehmensgröße läuft gpt-oss-120b mit einer Kopie je Karte und DeepSeek-V4-Flash mit einer Kopie je Kartenpaar, und dann entscheidet die Ausfalldomäne aus dem Abschnitt oben. Mit DeepSeek-V4-Flash setzt unser Leitfaden zur Unternehmensgröße zwei Kopien auf jeden Server mit vier Karten, genug, um die Beispielspitze von 80 zu halten, wenn ein Server ausfällt.
Vier RTX PRO 6000 fassen 384 GB, ein größeres Modell wie Qwen3.5-397B in FP8 mit 406 GB braucht also mehr als vier Karten. Betreiben Sie es in einem Server mit acht Karten, wo vLLMs Dokumentation Pipeline-Parallelismus nahelegt, „wenn die GPUs im Knoten keine NVLINK-Verbindung haben“. Unser Artikel dazu, ein Modell über PCIe oder NVLink auf mehrere GPUs aufzuteilen, behandelt den Verkehr jeder Aufteilung und die Peer-to-Peer-Einstellungen, die ein PCIe-Server braucht.
Gehäuse, Höheneinheiten und Strom je Rack-Platz
Lenovo baut den SR675 V3 in einem 3U-Gehäuse als 4-DW- und als 8-DW-GPU-Modell, beide für doppelt breite GPUs mit je 600 W ausgelegt, mit bis zu vier Netzteilen mit 1.800, 2.400 oder 2.600 W an 220 V. In dieser Baureihe belegen zwei Server mit je vier Karten 6U und ein Server mit acht Karten 3U. Ein 2U-Server nimmt nicht immer vier Karten mit 600 W auf. Lenovos SR650a V4 mit 2U unterstützt „vier doppelt breite GPUs mit 400 W oder zwei mit 600 W“, nimmt also zwei H200 NVL mit 600 W auf; Lenovos Leitfaden zur RTX PRO 6000 ergänzt eine auf 450 W begrenzte Version, „um den Einbau von 4 GPUs im SR650a V4 zu ermöglichen“.
Strom wird je Rack-Platz geplant. Acht Karten mit 600 W ziehen 4,8 kW, noch ohne Prozessoren, Arbeitsspeicher und Lüfter, mehr als die etwa 3,7 kW eines einphasigen 16-A-Stromkreises an 230 V; ein Server mit acht Karten braucht an seinem Platz also Drehstrom. Vier Karten ziehen 2,4 kW, und unser Artikel dazu, wie viele GPUs in einen Server passen, plant ab vier Karten mit 600 W mit 32 A oder Drehstrom. Zwei Server können in zwei Racks an getrennten Zuleitungen stehen, was auch die Wärme verteilt. Hat nur ein Rack-Platz Drehstrom, ist ein Server mit acht Karten unter Umständen die einzige Variante, die passt; unser Leitfaden zu Strom und Kühlung für GPU-Racks behandelt die Seite des Raums.
Prozessoren, Speicher, Ports und Lizenzen: was sich verdoppelt
NVIDIAs Konfigurationsleitfaden, aktualisiert am 30. September 2026, nennt „2x / 4x / 8x GPUs per server“ ausgewogen und geht von zwei CPU-Sockeln, sechs physischen Kernen je GPU und Systemspeicher in doppelter Höhe des gesamten GPU-Speichers aus. Kerne und Speicher skalieren mit den Karten, die Summen sind in beiden Varianten also gleich: 48 Kerne sowie 2.256 GB für acht H200 NVL oder 1.536 GB für acht RTX PRO 6000. Was sich verdoppelt, ist die Plattform: beim Minimum des Leitfadens vier Sockel statt zwei, zwei Gehäuse, zwei Sätze Netzteile, zwei Management-Controller, zwei gespiegelte Boot-Laufwerke, eine Kopie des Modellspeichers auf jedem Server und doppelt so viele Netzwerkports.
NVIDIA AI Enterprise wird pro GPU lizenziert, und sein Lizenzierungsleitfaden verlangt für einen Server oder eine Workstation, auf dem die Software läuft, eine Lizenz „für jede im Server oder in der Workstation installierte GPU“; acht solche Karten brauchen also in beiden Varianten acht Lizenzen. Jede H200 NVL enthält ein fünfjähriges Abonnement, das mit dem Versanddatum der Karte an den Serverhersteller plus 90 Tage beginnt; die RTX PRO 6000 Server Edition enthält keines. Software, die pro Server oder je Prozessor lizenziert wird, etwa ein Hypervisor oder ein Abonnement für ein Betriebssystem, folgt der Zahl der Server und Prozessoren.
Zwei Server erlauben außerdem einen gestaffelten Start: zuerst ein Server mit vier Karten und später ein zweiter derselben Bauart. Ein Server wächst nur dann von vier auf acht Karten, wenn er für acht bestellt wurde, wie unser Artikel zur Planung eines GPU-Servers für späteres Wachstum erklärt.
Welche Variante zu welchem Workload passt
| WORKLOAD | VARIANTE | GRUND |
|---|---|---|
| Chatmodell auf einer Karte | zwei × 4 | die Hälfte der Karten bedient bei Ausfall oder Update weiter |
| Klasse 355B bis 405B in FP8 | zwei × 4 H200 NVL | eine Kopie je Server auf seiner 4-fach-Brücke |
| 671B FP8 oder 1T INT4 | ein × 8 H200 NVL | das Modell braucht beide NVLink-Domänen |
| Über 384 GB auf RTX PRO 6000 | ein × 8 RTX PRO 6000 | Pipeline-Stufen über PCIe, nicht über das Netzwerk |
| Fine-Tuning auf acht Karten | ein × 8 | Gradienten laufen bei jedem Schritt über PCIe |
| Ein Rack-Platz mit Drehstrom | ein × 8 | 4,8 kW für die Karten an einem Platz |
Modellgrößen aus unserem H200-NVL-Leitfaden (Hugging Face, September 2026); unsere Lesart der Abschnitte oben. Ein Modell der Klasse 355B bis 405B in FP8, etwa GLM-4.5 mit 361 GB, passt nach seinen Gewichten in die 564 GB von vier H200 NVL; sein Cache bestimmt die Zahl der Gespräche.
Rack, Strom und Luftstrom prüfen wir vor dem Angebot. Beschreiben Sie Ihre Rack-Plätze, deren Zuleitungen und die geplanten Modelle im Formular unten.
Was wir liefern
Wir bauen KI-Server auf Bestellung mit vier oder acht H200 NVL und ihren Zweifach- und Vierfach-NVLink-Brücken oder mit der RTX PRO 6000 Server Edition, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente. Beide Varianten kommen unter einem EU-Vertrag und auf einer Rechnung, mit NVIDIA-AI-Enterprise- und vGPU-Lizenzen auf derselben Rechnung. Für Server, die Sie bereits betreiben, liefern wir auch nur die GPU-Karten, nach einer Kompatibilitätsprüfung von Plattform, Strom und Kühlung. Schicken Sie uns die Modelle und die Verfügbarkeit, die Sie brauchen, und wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für die passende Variante.
FAQ
Ist ein 8-GPU-Server besser als zwei 4-GPU-Server?
Lassen sich acht H200 NVL mit einer NVLink-Brücke verbinden?
Wie viel Speicher haben vier H200 NVL?
Was passiert, wenn ein GPU-Server ausfällt?
Wie viel Strom braucht ein Server mit 4 oder 8 GPUs?
Brauchen zwei 4-GPU-Server mehr Lizenzen für NVIDIA AI Enterprise als ein 8-GPU-Server?
Schicken Sie uns die Modelle, die Sie betreiben wollen, mit Präzision und Kontextlänge, die Spitzenzahl der Anfragen in Bearbeitung, wie lange der Dienst ausfallen darf, und die Rack-Plätze mit ihren Stromzuleitungen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für die passende Variante und prüfen Rack, Strom und Luftstrom vor dem Angebot.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages