DGX Spark vs H200 NVL: ein Entwicklungssystem und ein GPU-Server für die Produktion im Vergleich
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Der DGX Spark (128 GB) hat Unified Memory (LPDDR5x) mit 273 GB/s und Tensor-Kerne mit FP4 in einem Desktop-System; eine H200 NVL hat 141 GB HBM3e mit 4,8 TB/s, NVLink-Bridges für 2 oder 4 Karten und MIG, in einem Server mit bis zu 8 Karten
- Im Unternehmen gehören beide meist zu einem Plan: Entwickler bauen und testen auf 2 bis 4 DGX Spark, und 500 bis 2.000 Mitarbeiter nutzen den Dienst auf zwei H200-NVL-Servern, damit ein Server ausfallen kann
- NVIDIAs vLLM-Container ist Multi-Arch, vLLM stellt auf beiden dieselbe OpenAI-kompatible API bereit, und NIM führt gpt-oss-20b, Llama 3.1 8B und Nemotron 3 Nano als geprüft auf dem GB10 und der H200 NVL, gpt-oss-120b dagegen auf der H200 NVL und nicht auf dem GB10
- Auf dem Server wechselt der Host von Arm zu x86 und die Compute Capability von 12.1 zu 9.0; Images und eigene CUDA-Kernels brauchen deshalb Builds für beide, und NVFP4-Checkpoints weichen meist FP8, da NVIDIA für die H200 NVL keinen FP4-Tensor-Wert nennt
- Nach unserer Speicherschätzung lässt gpt-oss-120b bei 32K Platz für rund 30 Gespräche auf einem DGX Spark (128 GB) und rund 55 auf einer H200 NVL; die 17,6-mal höhere Speicherbandbreite der H200 NVL hebt die Obergrenze für das Generierungstempo jedes Nutzers um denselben Faktor
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
DGX Spark vs H200 NVL: Entwicklungssystem und Produktions-GPU
DGX Spark und H200 NVL erfüllen unterschiedliche Aufgaben. Der DGX Spark ist ein Desktop-System mit 128 GB Unified Memory (LPDDR5x) mit 273 GB/s und Tensor-Kernen mit FP4, gebaut für Entwickler, die Modelle prototypisch umsetzen, feinabstimmen und testen. Eine H200 NVL ist eine PCIe-Karte mit 141 GB HBM3e mit 4,8 TB/s, NVLink-Bridges für zwei oder vier Karten und MIG; sie kommt in einen Server, der ein Modell vielen Nutzern gleichzeitig bereitstellt. Alle Werte sind so angegeben, wie NVIDIA sie auf seinen Produktseiten nennt, abgerufen im Oktober 2026.
Für ein Unternehmen mit 200 bis 2.000 Mitarbeitern gehören beide meist zu einem Plan. Wer den Assistenten, die RAG-Pipeline oder die Agenten baut, arbeitet auf 2 bis 4 DGX Spark, und der Dienst, den 500 bis 2.000 Mitarbeiter nutzen, läuft auf H200-NVL-Servern. Auf welcher Hardware ein erstes Projekt starten sollte, behandelt unser Vergleich von DGX Spark, RTX PRO 6000 und H200 NVL für ein erstes KI-Projekt. Dieser Artikel behandelt den Schritt vom Schreibtisch in den Serverraum.
DGX Spark und H200 NVL: die Spezifikationen nebeneinander
| MERKMAL | DGX SPARK (128 GB) | H200 NVL |
|---|---|---|
| Speicher | 128 GB LPDDR5x, gemeinsam mit der CPU | 141 GB HBM3e je Karte |
| Speicherbandbreite | 273 GB/s | 4,8 TB/s |
| Tensor-Spitze mit Sparsity | 1 PFLOP FP4 | 3.341 TFLOPS FP8; kein FP4-Wert angegeben |
| Compute Capability | 12.1 (GB10) | 9.0 (als H200 geführt) |
| Host-CPU | 20 Arm-Kerne im GB10 | x86-Serverprozessoren wie AMD EPYC oder Intel Xeon |
| Anbindung weiterer GPUs | ConnectX-7 mit 200 Gb/s, bis zu vier Systeme | NVLink-Bridge für 2 oder 4 Karten, 900 GB/s je GPU |
| MIG | GB10 nicht in NVIDIAs MIG-Liste | bis zu 7 Instanzen mit je 16,5 GB |
| Leistungsaufnahme | 240-W-Netzteil, 140 W TDP des GB10 | bis zu 600 W je Karte, konfigurierbar |
| Bauform | Desktop, 150 × 150 × 50,5 mm | luftgekühlte PCIe-Karte mit zwei Slots, Server mit bis zu 8 GPUs |
| NVIDIA AI Enterprise | separater Anspruch | Fünf-Jahres-Abonnement enthalten |
NVIDIAs Produktseite zum DGX Spark und Hardware-Übersicht zum DGX Spark (aktualisiert am 10. September 2026); NVIDIAs Produktseite zur H200, Spalte H200 NVL; NVIDIAs Seite CUDA GPUs; MIG User Guide, unterstützte GPUs (aktualisiert am 11. September 2026); Host-CPUs von unserer Seite zu KI-Servern.
Die beiden Tensor-Werte gelten mit Sparsity und bei unterschiedlicher Präzision und lassen sich nicht vergleichen. NVIDIA nennt außerdem einen DGX Spark mit 64 GB, der nur über OEM-Partner verkauft wird und auf der Produktseite als „Coming Soon“ erscheint; dieser Artikel verwendet die Founders Edition mit 128 GB, die Version, die wir liefern.
Speicher und Bandbreite: 128 GB geteilt gegen 141 GB je Karte
Die 128 GB eines DGX Spark versorgen die 20 Arm-Kerne, DGX OS und die GPU aus einem Pool, während die 141 GB einer H200 NVL allein der GPU gehören. Unsere Auslegungsartikel setzen deshalb auf einem DGX Spark (128 GB) 102 GB, rund 95 GiB, für Gewichte und KV-Cache an. Für eine dedizierte Karte nimmt unsere Regel 90 Prozent des Speichers, den der Treiber meldet, abzüglich 3 GiB; das lässt auf einer H200 NVL rund 123 GiB, und vier Karten an einer Vierfach-NVLink-Bridge halten zusammen 564 GB.
Für gpt-oss-120b mit seinem Checkpoint von 60,8 GiB und rund 1,1 GiB 16-Bit-Cache je Gespräch mit 32K Token ergibt das nach unserer Speicherschätzung Platz für rund 30 Gespräche auf einem DGX Spark (128 GB) und rund 55 auf einer H200 NVL. Mit der Speichereinstellung 0,7, die NVIDIAs vLLM-Release-Notes für den DGX Spark empfehlen, sinkt der Wert für den Spark auf rund 20.
Die Speicherbandbreite setzt die Obergrenze für das Generierungstempo, weil jedes erzeugte Token die Gewichte liest, die das Modell dafür verwendet. Die 4,8 TB/s der H200 NVL sind das 17,6-Fache der 273 GB/s des DGX Spark, was diese Grenze für dasselbe Modell bei gleicher Präzision um denselben Faktor anhebt; gemessene Geschwindigkeiten hängen außerdem von Engine, Kernels und Batchgröße ab. Ein Test auf einem Spark zeigt, dass Modell, Prompt-Vorlage und Pipeline funktionieren, nicht aber die Antwortzeiten auf dem Server. Unsere Benchmarks zum DGX Spark sammeln die Messwerte, und das Tempo je Anfrage bei 1 bis 32 Anfragen steht in unserem Artikel zu einem DGX Spark, den sich ein Team teilt. Lasttests mit der Parallelität der Produktion gehören vor dem Rollout auf den H200-NVL-Server.
Auf 2 bis 4 DGX Spark entwickeln, auf H200-NVL-Servern bereitstellen
Nehmen Sie ein Unternehmen mit 2.000 Mitarbeitern, das einen privaten Assistenten auf gpt-oss-120b mit 32K Kontext plant. Unser Beitrag zur Auslegung eines privaten ChatGPT-Servers nach Unternehmensgröße arbeitet mit Beispielwerten von 80 gleichzeitig laufenden Anfragen in der Spitze. Zwei Server mit je zwei H200 NVL halten rund 220 Gespräche und rund 110, wenn ein Server ausfällt, was die Spitze weiterhin abdeckt. Für 500 Mitarbeiter und eine Spitze von 20 hält eine H200 NVL bereits rund 55, sodass zwei Server mit je einer Karte den Dienst über den Ausfall eines Servers tragen; lassen Sie Steckplätze und Strom für eine zweite Karte je Server frei.
Auf der Entwicklungsseite passen zwei DGX Spark zu einem kleinen Plattformteam. Einer betreibt das Kandidatenmodell hinter vLLM für die Anwendungsentwickler, der andere übernimmt Evaluierungsläufe und Fine-Tuning-Experimente, die auf einem Spark mit dem Serving um denselben Speicher konkurrieren würden. NVIDIAs Produktseite nennt Fine-Tuning „bis zu 70 Milliarden Parameter“, was NVIDIAs Fine-Tuning-Playbook mit QLoRA erreicht, und Inferenz bis 200 Milliarden Parameter auf einem System mit 128 GB, was nach unserer Rechnung nur für 4-Bit-Gewichte gilt. Vier DGX Spark passen, wenn mehrere Teams gleichzeitig Anwendungen bauen oder wenn ein größeres Modell über verbundene Systeme getestet werden muss: NVIDIA nennt bis zu 400 Milliarden Parameter auf zwei Systemen mit 128 GB und bis zu 700 Milliarden auf vier.
Wir liefern die DGX Spark Founders Edition für die Entwicklung und auf Bestellung gebaute KI-Server mit H200 NVL für die Produktion, unter einem EU-Vertrag und auf einer Rechnung. Nennen Sie uns Ihre Mitarbeiterzahl, das Modell und die Zahl der Entwickler, die darauf aufbauen, und wir legen beide Seiten aus.
Was vom DGX Spark auf den H200-NVL-Server mitgeht
vLLM stellt aus seinem HTTP-Server auf beiden Systemen die OpenAI-APIs für Completions und Chat Completions bereit, darunter /v1/chat/completions. Eine Anwendung, die gegen vLLM auf einem Spark gebaut wurde, zeigt danach auf die Adresse des Servers und sendet dieselben Anfragen. Prompts, Evaluierungssätze und RAG-Indizes gehen ebenfalls mit, ebenso Checkpoints in einer Präzision, die beide Systeme ausführen.
NVIDIAs vLLM-Container auf NGC zeigt „Multi-Arch Support“ mit „Yes“; sein neuestes Tag am 28. September 2026 war 26.09-py3, das NVIDIAs Release-Notes als vLLM 0.29.0 auf CUDA 13.4.1 angeben. Die Seite nennt die Architekturen nicht; prüfen Sie deshalb mit docker manifest inspect, ob das Tag sowohl den Arm-Host des Spark als auch den x86-Host des Servers bedient.
NVIDIA NIM führt geprüfte GPUs je Modell. Die Support-Matrix, aktualisiert am 6. Oktober 2026, nennt für gpt-oss-20b, llama-3.1-8b-instruct und nemotron-3-nano sowohl NVIDIA-GB10 als auch NVIDIA-H200-NVL. Für gpt-oss-120b führt sie die H200 NVL und nicht den GB10; ein Team, das dieses Modell in der Produktion als NIM betreiben will, testet es deshalb auf dem Spark mit vLLM und prüft den NIM auf dem Server. NVIDIAs Quickstart für den DGX Spark gibt Zugang zu berechtigten NIM-Containern „über eine Mitgliedschaft im NVIDIA Developer Program oder über NVIDIA AI Enterprise“. NVIDIAs H200-Seite sagt: „Die H200 NVL wird mit einem Fünf-Jahres-Abonnement für NVIDIA AI Enterprise geliefert“, während auf dem DGX Spark der Anspruch „nur besteht, wenn Sie es gekauft, eine Evaluierung angefordert oder ein NVIDIA Entitlement Certificate erhalten haben“.
Was sich ändert: Arm- und x86-Hosts, Compute Capability 12.1 und 9.0
Der DGX Spark betreibt DGX OS auf Basis von Ubuntu 24.04 auf 20 Arm-Kernen, während unsere H200-NVL-Server x86-Prozessoren wie AMD EPYC oder Intel Xeon verwenden. Ihre eigenen Images brauchen Builds für linux/arm64 und linux/amd64, und jedes Python-Paket mit kompilierten Erweiterungen braucht ein Wheel oder einen Build für beide.
NVIDIAs Seite CUDA GPUs führt den GB10 des DGX Spark mit 12.1 und die H200 mit 9.0. NVIDIAs Blackwell-Kompatibilitätsleitfaden hält fest: „Ein für eine bestimmte Compute Capability erzeugtes Cubin wird auf jeder GPU mit derselben Hauptrevision und derselben oder einer höheren Nebenrevision unterstützt“, und PTX läuft nur auf GPUs, deren Compute Capability mindestens der entspricht, die es voraussetzt. Ein eigener Kernel oder eine Erweiterung, auf dem Spark für 12.1 kompiliert, läuft deshalb nicht auf der H200 NVL. Bauen Sie ihn zusätzlich mit dem Ziel 9.0, zum Beispiel -gencode arch=compute_, und testen Sie beide Builds in derselben CI-Pipeline.
NVIDIAs vLLM-Release-Notes für 26.09 warnen, dass die Standard-Speicherzuteilung auf Unified Memory wie beim DGX Spark „zu Out-of-Memory-Fehlern führen kann“, und empfehlen --gpu-memory-utilization 0.7. Außerdem verlangen sie --max-num-seqs 4 für Nemotron Nano V3 und Super V3 in NVFP4 auf dem Spark. Eine Produktivkonfiguration setzt beide Werte nach der H200 NVL und der gemessenen Last. NVIDIAs Portierungsleitfaden ergänzt für den DGX Spark: „Die GPUDirect-RDMA-Technologie wird nicht unterstützt“; Storage- und Netzwerkpfade, die darauf aufbauen, lassen sich deshalb nur auf dem Server testen.
FP4 auf dem DGX Spark, FP8 auf der H200 NVL
NVIDIA beschreibt die Tensor-Kerne des DGX Spark als fünfte Generation „mit FP4-Unterstützung“, und NVIDIAs vLLM-Playbook für den Spark stellt einen NVFP4-Checkpoint bereit. Die Produktseite der H200 nennt Tensor-Werte nach unten bis FP8 und INT8 und keinen für FP4. Ein Modell, das auf einem Spark in NVFP4 ausgewählt wurde, kommt auf der H200 NVL meist in FP8 an, was seine Gewichte um rund 70 Prozent vergrößert: NVIDIAs Checkpoints von Llama 4 Scout haben in NVFP4 65,3 GB und in FP8 111,6 GB.
Evaluieren Sie auf dem Spark den Checkpoint, den Sie bereitstellen werden, sofern er passt, damit die Antwortqualität an denselben Gewichten gemessen wird. Qwen3.8-27B läuft in seiner FP8-Version mit 30,9 GB auf einem Spark und auf einer H200 NVL. vLLMs Seite zur Quantisierung, datiert auf den 14. September 2026, markiert seine Marlin-Kernels für „GPTQ/AWQ/FP8/FP4“ als auf Hopper unterstützt, und seine Seite zum Model Optimizer, datiert auf den 2. Oktober 2026, hält fest, dass ohne nativen FP4-Kernel „vLLM auf eine reine Gewichtsausführung (W4A16) über Marlin zurückfällt“. Manche FP4-Checkpoints laden deshalb auf der H200 NVL und sparen dort Speicher, während die Arithmetik in 16 Bit läuft. Unser Artikel zu FP4-Modellen auf H200 NVL und Ada-GPUs behandelt, welche Formate laufen und mit welchen Nachteilen.
500 bis 2.000 Nutzer bedienen: Batching, MIG und NVLink
Ein Produktivdienst bündelt viele Anfragen in einem Durchlauf über die Gewichte, und die Bandbreite der H200 NVL bestimmt, wie schnell jeder Durchlauf sie liest. Die Karte bietet außerdem zwei Funktionen, die dem DGX Spark fehlen. NVIDIAs MIG User Guide führt die H200 NVL mit sieben Instanzen und den GB10 nicht, und die Produktseite nennt „bis zu 7 MIGs mit je 16,5 GB“. Eine Karte kann deshalb das Embedding-Modell und den Reranker eines RAG-Dienstes tragen, neben dem Hauptmodell auf den anderen Karten.
NVLink verbindet zwei oder vier H200 NVL mit 900 GB/s je GPU, sodass sich ein Modell über 141 GB oder sein Cache für lange Kontexte über Karten mit schneller Verbindung verteilen kann. DGX-Spark-Systeme verbinden sich über ConnectX-7 mit 200 Gb/s, rund 25 GB/s.
| AUFGABE | WO SIE LÄUFT | WARUM |
|---|---|---|
| Modell auswählen | DGX Spark | NVIDIA nennt bis zu 200B in 4 Bit auf einem System |
| Fine-Tuning-Experimente | DGX Spark | NVIDIA nennt bis zu 70B mit QLoRA auf einem System |
| RAG-Pipeline aufbauen | DGX Spark, Multi-Arch | dieselbe API und dieselben Container wie der Server |
| Lasttests in der Spitze | H200-NVL-Server | Tempo und Batching wie in der Produktion |
| 500 bis 2.000 Mitarbeiter | zwei H200-NVL-Server | 4,8 TB/s je Karte, ein Server kann ausfallen |
| Lange Kontexte, große LLMs | H200 NVL, NVLink | 2 oder 4 Karten mit 900 GB/s je GPU |
| Isolierte Instanzen je Team | H200 NVL mit MIG | bis zu 7 Instanzen mit je 16,5 GB |
Unsere Auswertung von NVIDIAs Produktseiten zu DGX Spark und H200 und des MIG User Guide, Oktober 2026; Serverzahlen aus dem Rechenbeispiel oben.
Bevor wir einen H200-NVL-Server anbieten, prüfen wir Rack, Strom und Luftstrom. Schicken Sie uns über das Formular unten die Stromzuführung am Rackplatz und das Modell, das Sie auf dem DGX Spark getestet haben.
Was wir liefern
Wir liefern die DGX Spark Founders Edition (128 GB) für die Entwicklung und die H200 NVL mit NVLink-Bridges, als Karten oder in nach Auftrag gebauten KI-Servern, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Den Produktivserver legen wir nach Modell, Präzision, Kontextlänge und der Spitzenzahl gleichzeitig laufender Anfragen aus, und Konfiguration und Angebot folgen innerhalb eines Werktages. NVIDIA-AI-Enterprise-Lizenzen kommen auf dieselbe Rechnung wie die Hardware. Unsere Seite zum DGX Spark und unser Sortiment professioneller GPUs nennen die Details, und der Betrieb von Modell, RAG und MLOps auf der Hardware ist unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
DGX Spark vs H200: was ist schneller?
Ist der DGX Spark für die Produktion geeignet?
DGX Spark oder GPU-Server für die KI-Plattform im Unternehmen?
Wie migriert man vom DGX Spark auf einen H200-NVL-Server?
Unterstützt die H200 NVL FP4 wie der DGX Spark?
Wie schneidet der Speicher des DGX Spark gegen eine Rechenzentrums-GPU ab?
Schicken Sie uns das Modell, das Sie auf dem DGX Spark testen, seine Präzision, die Kontextlänge, Ihre Mitarbeiterzahl und die Spitzenzahl gleichzeitig laufender Anfragen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für die DGX-Spark-Systeme und die H200-NVL-Server; Rack, Strom und Luftstrom prüfen wir, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages