H200 NVL für Modelle mit 235B bis 671B: wie viele Karten und wie sie verbunden werden
- Eine H200 NVL fasst 141 GB HBM3e; NVLink-Brücken verbinden zwei oder vier Karten mit 900 GB/s je GPU, und NVIDIAs Partnerserver nehmen bis zu acht Karten auf; nach unserer Lesart dieser beiden Grenzen hat ein Server mit acht Karten höchstens zwei NVLink-Domänen zu je vier Karten, die über PCIe verbunden sind
- Hopper hat keine FP4-Arithmetik: TensorRT-LLM führt dafür FP8- und INT4-Formate, aber weder NVFP4 noch MXFP4, und vLLM führt NVFP4-Checkpoints darauf nur Weight-only aus; dimensionieren Sie eine H200 NVL also nach FP8- oder INT4-Gewichten, nicht nach einem für Blackwell erstellten NVFP4-Checkpoint
- Allein nach den Gewichten, in NVIDIAs Konfigurationen mit einer, zwei, vier oder acht Karten, braucht gpt-oss-120b eine Karte, Qwen3-235B in FP8 zwei, GLM-4.5, Qwen3.5-397B und Llama 4 Maverick in FP8 vier und DeepSeek-V3 in FP8 oder Kimi K2 Thinking acht
- Der KV-Cache kommt hinzu: Die eigene Hardwaretabelle von GLM verlangt mindestens vier H200 in FP8 und acht für den vollen Kontext von 128K
- NVIDIA veröffentlicht für diese Modelle keine Ergebnisse mit der H200 NVL; NVIDIAs Werte je GPU stammen von H200-SXM-Systemen, in denen sich alle acht GPUs eine NVLink-Domäne teilen
Die Einheit der Kapazität sind vier Karten
Die H200 NVL ist eine luftgekühlte PCIe-Karte im Dual-Slot-Format mit 141 GB HBM3e bei 4,8 TB/s und einer konfigurierbaren Leistungsgrenze von bis zu 600 W. Ihre Verbindungstechnik ist es, die große Modelle auf PCIe-Servern möglich macht: NVLink-Brücken für zwei oder vier Karten verbinden diese mit 900 GB/s je GPU, gegenüber 128 GB/s bei PCIe Gen5. NVIDIA fasst das so zusammen: GPU-zu-GPU-Kommunikation „7-mal schneller als PCIe der fünften Generation“. NVIDIAs Referenzarchitektur nennt die Größe dieser Domäne, „bis zu vier über NVIDIA NVLink verbundene GPUs“, und die Rechnung dazu: „der kombinierte H200-GPU-Speicher beträgt 564 GB“.
NVIDIAs Partnerserver nehmen bis zu acht Karten auf. NVIDIA sagt nicht in einem Satz, wie die Brücken in einem solchen Server sitzen, aber eine NVLink-Grenze von vier Karten und acht Karten je Server ergeben zwei Domänen zu je vier Karten, die untereinander über PCIe verbunden sind. Von dieser Anordnung geht dieser Artikel bei der Dimensionierung aus. Jede Karte wird außerdem mit einem fünfjährigen Abonnement von NVIDIA AI Enterprise ausgeliefert, das NIM-Microservices und den Support von NVIDIA umfasst; Open-Source-Laufzeitumgebungen wie TensorRT-LLM und vLLM laufen auch ohne dieses Abonnement, wie unser Artikel zur Lizenzierung erklärt.
FP8 ja, FP4 nein
Hopper hat FP8 in die Tensor-Kerne gebracht; FP4 kam mit Blackwell. NVIDIAs Dokumentation zu TensorRT-LLM stellt ausdrücklich fest, dass „NVFP4 nur auf NVIDIA Blackwell unterstützt wird“, und ihre Quantisierungsmatrix führt für Hopper weder NVFP4 noch MXFP4. Was Hopper sehr wohl ausführt, ist FP8 in mehreren Skalierungsverfahren sowie 4-Bit-Integer-Gewichte über AWQ und GPTQ, entweder mit 16-Bit-Aktivierungen (W4A16) oder mit FP8-Aktivierungen (W4A8).
Das ändert die Rechnung. Hinter einer 4-Bit-Größe auf einer Model Card steckt oft NVFP4, das nur Blackwell nativ ausführt: Die NVFP4-Version von Qwen3-235B hat 134 GB, was eine einzige H200 NVL nahelegen würde, doch TensorRT-LLM unterstützt NVFP4 auf Hopper nicht, und vLLM führt es dort nur Weight-only aus, mit 16-Bit-Arithmetik. Auf Hopper bleiben der FP8-Checkpoint mit 236 GB oder eine INT4-Version mit AWQ oder GPTQ, sofern es für das Modell eine gibt und ihre Genauigkeit akzeptabel ist. NVIDIAs eigenes Rezept für DeepSeek-R1 mit TensorRT-LLM nutzt auf Hopper den FP8-Checkpoint und behält den FP4-Checkpoint Blackwell vor.
Gewichte, Modell für Modell
| MODELL | PARAMETER | AUF HOPPER | GEWICHTE | KARTEN |
|---|---|---|---|---|
| gpt-oss-120b | 117B, 5,1B aktiv | MXFP4 oder FP8 | 65,3 GB in MXFP4 | 1 |
| Qwen3-235B-2507 | 235B, 22B aktiv | FP8 | 236 GB | 2 |
| Qwen3-235B-2507 | 235B, 22B aktiv | BF16 | 470 GB | 4 |
| GLM-4.5 | 355B, 32B aktiv | FP8 | 361 GB | 4 |
| Qwen3.5-397B | 397B, 17B aktiv | FP8 | 406 GB | 4 |
| Llama 4 Maverick | 400B, 17B aktiv | FP8 | 417 GB | 4 |
| Llama 3.1 405B | 405B, dicht | FP8 | etwa 487 GB | 4, knapp |
| DeepSeek-V3.1 oder R1 | 671B, 37B aktiv | FP8, nativ | etwa 689 GB | 8 |
| Kimi K2 Thinking | 1T, 32B aktiv | INT4, nativ | 594 GB | 8 |
| Kimi K2 Instruct | 1T, 32B aktiv | FP8 | 1.029 GB | 8, mit etwa 99 GB Reserve |
Model Cards und Repository-Größen auf Hugging Face, September 2026; der FP8-Wert für Llama 3.1 405B ist unsere Summe aus den Parametertypen des Checkpoints. „Karten“ ist die kleinste der Konfigurationen von NVIDIA mit einer, zwei, vier oder acht Karten, deren 141 GB je Karte die Gewichte fassen, noch ohne Cache und Laufzeitumgebung; allein nach der Kapazität würden drei Karten GLM-4.5, Qwen3.5-397B und Llama 4 Maverick in FP8 fassen, aber die Brücken verbinden zwei oder vier.
gpt-oss-120b ist die Ausnahme von der FP4-Regel, denn seine MXFP4-Gewichte laufen auch auf Hopper: OpenAI gibt an, dass es auf einer einzelnen GPU mit 80 GB wie der H100 läuft, und NVIDIAs Performance-Tabelle für TensorRT-LLM führt es auf einer H200 in FP8. Eine Karte genügt so oder so, und es bleibt Platz für seinen Cache.
Was hinzukommt
Die Gewichte sind die Untergrenze. Für jeden Nutzer in einem Gespräch liegt ein KV-Cache auf den Karten, und bei langen Kontexten wächst der Cache schnell über den freien Speicher hinaus. Zwei Modellanbieter beziffern das. Die Hardwaretabelle von GLM zu GLM-4.5 nennt vier H200 als Minimum in FP8 und acht für den vollen Kontext von 128K Token, unter ausdrücklich genannten Bedingungen: spekulatives Dekodieren, Batches von bis zu acht und mehr als 1 TB Serverspeicher. Qwen gibt an, dass Qwen3-235B-A22B-2507 insgesamt etwa 1.000 GB GPU-Speicher braucht, um einen Kontext von einer Million Token zu nutzen.
Unser 70B-Rechenbeispiel zeigt die Methode an einem kleineren Modell: Gewichte, dann Cache je Token mal Kontext mal Nutzer, dann eine Reserve für die Laufzeitumgebung, die wir hier mit zehn Prozent des Speichers ansetzen. Auf Llama 3.1 405B in FP8 angewandt: Die vier Karten einer Domäne melden dem Treiber zusammen 561,6 GiB, zehn Prozent davon bleiben als Reserve, und die Gewichte belegen etwa 487 GB oder 454 GiB, sodass etwa 52 GiB für den Cache bleiben. Bei 252 KiB je Token in FP8 sind das etwa 215.000 Token oder sechs Gespräche mit 32.000 Token. Um ein größeres Team zu bedienen, braucht es meist die zweite Domäne.
Über die Domänengrenze hinweg
Innerhalb einer Domäne aus vier Karten können die Karten jede Schicht über NVLink untereinander aufteilen, das ist Tensor-Parallelismus. Zwischen den beiden Domänen eines Servers mit acht Karten läuft der Verkehr über PCIe mit einem Siebtel dieser Bandbreite, deshalb teilt eine gängige Anordnung das Modell stattdessen in Stufen auf, das ist Pipeline-Parallelismus, wobei jede Stufe auf einer NVLink-Domäne liegt. Dieselbe Aufteilung beschreibt die Dokumentation von vLLM über Server hinweg: Tensor-Parallelismus innerhalb, Pipeline-Parallelismus dazwischen. Das funktioniert und kostet im Vergleich zu einer großen NVLink-Domäne etwas Latenz je Token.
Deshalb lassen sich auch NVIDIAs veröffentlichte Zahlen für diese Modelle nicht direkt übertragen. NVIDIAs Performance-Tabelle für TensorRT-LLM, aktualisiert im September 2026, meldet für Qwen3 235B in FP8 auf vier H200 einen Durchsatz von 3.268 Ausgabe-Token pro Sekunde und GPU, bei Prompts und Antworten von 1.024 Token, und für DeepSeek R1 in FP8 auf acht GPUs 1.620 je GPU. Das sind H200-SXM-GPUs mit 700 W in einem DGX H200, in dem sich alle acht eine NVLink-Domäne teilen. Der Wert für vier GPUs lässt sich besser auf eine H200-NVL-Domäne übertragen als der Wert für acht GPUs auf einen Server mit zwei Domänen. Für die H200 NVL selbst stammen die veröffentlichten Ergebnisse mit mehreren Karten aus MLPerf®-Benchmarks: In MLPerf Inference v6.0, veröffentlicht im April 2026, verarbeitete ein Dell PowerEdge XE7740 mit acht H200 NVL mit Llama 2 70B, Variante mit 99 Prozent Genauigkeit, im Offline-Szenario insgesamt 32.004 Token pro Sekunde (Kategorie Datacenter, Closed Division, Eintrag 6.0-0021, abgerufen von mlcommons.org am 24. September 2026, Ergebnis von der MLCommons Association verifiziert), etwa 4.000 je Karte nach unserer Rechnung: Systemergebnis geteilt durch die Zahl der GPUs, keine MLPerf-Metrik.
The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information.
Sinnvolle Konfigurationen
| KARTEN | NVLINK | SPEICHER | WAS GUT DARAUF LÄUFT |
|---|---|---|---|
| 1 | ohne | 141 GB | gpt-oss-120b; ein 70B-Modell in FP8 für ein Team |
| 2 | 2-fach-Brücke | 282 GB | Qwen3-235B in FP8 mit kurzen Kontexten |
| 4 | 4-fach-Brücke | 564 GB | Modelle der Klasse 355B bis 405B in FP8; Qwen3-235B in FP8 mit langen Kontexten |
| 8 | zwei 4-fach-Domänen | 1.128 GB | DeepSeek-V3 oder R1 in FP8; Kimi K2 Thinking; GLM-4.5 mit vollem Kontext |
Der Speicher ist die Summe aus 141 GB je Karte; Zweifach- und Vierfach-Brücken laut NVIDIAs Spezifikationen der H200 NVL; zwei Vierfach-Domänen in einem Server mit acht Karten sind unsere Lesart von NVIDIAs NVLink-Grenze von vier GPUs.
Der Server für acht Karten ist eine Maschine mit 3U bis 5U und acht doppelt breiten PCIe-Steckplätzen, die jeweils für 600 W ausgelegt sind, etwa Dells PowerEdge XE7740 mit 4U, Lenovos ThinkSystem SR675 V3 mit 3U oder Supermicros SYS-521GE-TNRT mit 5U. Acht Karten mit 600 W ziehen 4,8 kW, bevor Prozessoren, Arbeitsspeicher und Lüfter hinzukommen, womit für den ganzen Server ein einphasiger 16-A-Stromkreis mit etwa 3,7 kW nicht mehr ausreicht; unser Artikel dazu, wie viele GPUs in einen Server passen, behandelt Strom und Luftstrom. Die Brücken gehören zur Bestellung und sind kein Zubehör: HPEs Dokumentation weist darauf hin, dass H200-NVL-Brücken nur mit H200-NVL-Karten funktionieren.
Wann die H200 NVL das falsche Werkzeug ist
Für Modelle, die nativ in FP4 veröffentlicht werden, etwa die Expertengewichte von DeepSeek-V4-Flash, hat Hopper keinen nativen Pfad, und die Blackwell-Karten sind die naheliegende Wahl: die RTX PRO 6000 mit NVFP4 über PCIe oder ein DGX B300 mit 2,1 TB HBM3e in einer NVLink-Domäne, den unser B300-Vergleich behandelt. Jenseits von etwa 1 TB Gewichten lassen acht H200 NVL wenig Platz für den Cache, den das Serving braucht. Und bei einem 70B-Modell lautet die Frage: eine H200 NVL oder zwei RTX PRO 6000; sie beantwortet unser 70B-Rechenbeispiel.
Was wir liefern
Eurokommerz liefert die NVIDIA H200 NVL EU-weit mit Herstellergarantie, zusammen mit den Zweifach- und Vierfach-NVLink-Brücken und dem Server, der nach Auftrag um sie herum gebaut wird. Jede Karte kommt mit ihrem fünfjährigen Abonnement von NVIDIA AI Enterprise. Schicken Sie uns das Modell und den Kontext, den Sie brauchen, und wir nennen Ihnen die Kartenzahl, die Anordnung der Brücken und das Leistungsbudget.
FAQ
Wie viele H200 NVL braucht DeepSeek-R1 oder V3?
Kann die H200 NVL NVFP4-Modelle ausführen?
Lassen sich acht H200 NVL über NVLink verbinden?
Wie viel Speicher haben vier H200 NVL?
Läuft gpt-oss-120b auf einer H200 NVL?
Wie viel Leistung zieht ein H200-NVL-Server mit acht Karten?
Schicken Sie uns das Modell, die Präzision, mit der Sie es betreiben wollen, sowie den Kontext und die Zahl gleichzeitiger Anfragen, die Sie brauchen. Wir nennen Ihnen die Kartenzahl, die Anordnung der Brücken und den Server um die Karten herum. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages