BLOG · VERGLEICH ·

DGX Spark vs H200 NVL: ein Entwicklungssystem und ein GPU-Server für die Produktion im Vergleich

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Der DGX Spark (128 GB) hat Unified Memory (LPDDR5x) mit 273 GB/s und Tensor-Kerne mit FP4 in einem Desktop-System; eine H200 NVL hat 141 GB HBM3e mit 4,8 TB/s, NVLink-Bridges für 2 oder 4 Karten und MIG, in einem Server mit bis zu 8 Karten
  • Im Unternehmen gehören beide meist zu einem Plan: Entwickler bauen und testen auf 2 bis 4 DGX Spark, und 500 bis 2.000 Mitarbeiter nutzen den Dienst auf zwei H200-NVL-Servern, damit ein Server ausfallen kann
  • NVIDIAs vLLM-Container ist Multi-Arch, vLLM stellt auf beiden dieselbe OpenAI-kompatible API bereit, und NIM führt gpt-oss-20b, Llama 3.1 8B und Nemotron 3 Nano als geprüft auf dem GB10 und der H200 NVL, gpt-oss-120b dagegen auf der H200 NVL und nicht auf dem GB10
  • Auf dem Server wechselt der Host von Arm zu x86 und die Compute Capability von 12.1 zu 9.0; Images und eigene CUDA-Kernels brauchen deshalb Builds für beide, und NVFP4-Checkpoints weichen meist FP8, da NVIDIA für die H200 NVL keinen FP4-Tensor-Wert nennt
  • Nach unserer Speicherschätzung lässt gpt-oss-120b bei 32K Platz für rund 30 Gespräche auf einem DGX Spark (128 GB) und rund 55 auf einer H200 NVL; die 17,6-mal höhere Speicherbandbreite der H200 NVL hebt die Obergrenze für das Generierungstempo jedes Nutzers um denselben Faktor

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

DGX Spark vs H200 NVL: Entwicklungssystem und Produktions-GPU

DGX Spark und H200 NVL erfüllen unterschiedliche Aufgaben. Der DGX Spark ist ein Desktop-System mit 128 GB Unified Memory (LPDDR5x) mit 273 GB/s und Tensor-Kernen mit FP4, gebaut für Entwickler, die Modelle prototypisch umsetzen, feinabstimmen und testen. Eine H200 NVL ist eine PCIe-Karte mit 141 GB HBM3e mit 4,8 TB/s, NVLink-Bridges für zwei oder vier Karten und MIG; sie kommt in einen Server, der ein Modell vielen Nutzern gleichzeitig bereitstellt. Alle Werte sind so angegeben, wie NVIDIA sie auf seinen Produktseiten nennt, abgerufen im Oktober 2026.

Für ein Unternehmen mit 200 bis 2.000 Mitarbeitern gehören beide meist zu einem Plan. Wer den Assistenten, die RAG-Pipeline oder die Agenten baut, arbeitet auf 2 bis 4 DGX Spark, und der Dienst, den 500 bis 2.000 Mitarbeiter nutzen, läuft auf H200-NVL-Servern. Auf welcher Hardware ein erstes Projekt starten sollte, behandelt unser Vergleich von DGX Spark, RTX PRO 6000 und H200 NVL für ein erstes KI-Projekt. Dieser Artikel behandelt den Schritt vom Schreibtisch in den Serverraum.

DGX Spark und H200 NVL: die Spezifikationen nebeneinander

MERKMALDGX SPARK (128 GB)H200 NVL
Speicher128 GB LPDDR5x, gemeinsam mit der CPU141 GB HBM3e je Karte
Speicher­bandbreite273 GB/s4,8 TB/s
Tensor-Spitze mit Sparsity1 PFLOP FP43.341 TFLOPS FP8; kein FP4-Wert angegeben
Compute Capability12.1 (GB10)9.0 (als H200 geführt)
Host-CPU20 Arm-Kerne im GB10x86-Server­prozessoren wie AMD EPYC oder Intel Xeon
Anbindung weiterer GPUsConnectX-7 mit 200 Gb/s, bis zu vier SystemeNVLink-Bridge für 2 oder 4 Karten, 900 GB/s je GPU
MIGGB10 nicht in NVIDIAs MIG-Listebis zu 7 Instanzen mit je 16,5 GB
Leistungs­aufnahme240-W-Netzteil, 140 W TDP des GB10bis zu 600 W je Karte, konfigurierbar
BauformDesktop, 150 × 150 × 50,5 mmluftgekühlte PCIe-Karte mit zwei Slots, Server mit bis zu 8 GPUs
NVIDIA AI Enterpriseseparater AnspruchFünf-Jahres-Abonnement enthalten

NVIDIAs Produktseite zum DGX Spark und Hardware-Übersicht zum DGX Spark (aktualisiert am 10. September 2026); NVIDIAs Produktseite zur H200, Spalte H200 NVL; NVIDIAs Seite CUDA GPUs; MIG User Guide, unterstützte GPUs (aktualisiert am 11. September 2026); Host-CPUs von unserer Seite zu KI-Servern.

Die beiden Tensor-Werte gelten mit Sparsity und bei unterschiedlicher Präzision und lassen sich nicht vergleichen. NVIDIA nennt außerdem einen DGX Spark mit 64 GB, der nur über OEM-Partner verkauft wird und auf der Produktseite als „Coming Soon“ erscheint; dieser Artikel verwendet die Founders Edition mit 128 GB, die Version, die wir liefern.

Speicher und Bandbreite: 128 GB geteilt gegen 141 GB je Karte

Die 128 GB eines DGX Spark versorgen die 20 Arm-Kerne, DGX OS und die GPU aus einem Pool, während die 141 GB einer H200 NVL allein der GPU gehören. Unsere Auslegungsartikel setzen deshalb auf einem DGX Spark (128 GB) 102 GB, rund 95 GiB, für Gewichte und KV-Cache an. Für eine dedizierte Karte nimmt unsere Regel 90 Prozent des Speichers, den der Treiber meldet, abzüglich 3 GiB; das lässt auf einer H200 NVL rund 123 GiB, und vier Karten an einer Vierfach-NVLink-Bridge halten zusammen 564 GB.

Für gpt-oss-120b mit seinem Checkpoint von 60,8 GiB und rund 1,1 GiB 16-Bit-Cache je Gespräch mit 32K Token ergibt das nach unserer Speicherschätzung Platz für rund 30 Gespräche auf einem DGX Spark (128 GB) und rund 55 auf einer H200 NVL. Mit der Speichereinstellung 0,7, die NVIDIAs vLLM-Release-Notes für den DGX Spark empfehlen, sinkt der Wert für den Spark auf rund 20.

Die Speicherbandbreite setzt die Obergrenze für das Generierungstempo, weil jedes erzeugte Token die Gewichte liest, die das Modell dafür verwendet. Die 4,8 TB/s der H200 NVL sind das 17,6-Fache der 273 GB/s des DGX Spark, was diese Grenze für dasselbe Modell bei gleicher Präzision um denselben Faktor anhebt; gemessene Geschwindigkeiten hängen außerdem von Engine, Kernels und Batchgröße ab. Ein Test auf einem Spark zeigt, dass Modell, Prompt-Vorlage und Pipeline funktionieren, nicht aber die Antwortzeiten auf dem Server. Unsere Benchmarks zum DGX Spark sammeln die Messwerte, und das Tempo je Anfrage bei 1 bis 32 Anfragen steht in unserem Artikel zu einem DGX Spark, den sich ein Team teilt. Lasttests mit der Parallelität der Produktion gehören vor dem Rollout auf den H200-NVL-Server.

Auf 2 bis 4 DGX Spark entwickeln, auf H200-NVL-Servern bereitstellen

Nehmen Sie ein Unternehmen mit 2.000 Mitarbeitern, das einen privaten Assistenten auf gpt-oss-120b mit 32K Kontext plant. Unser Beitrag zur Auslegung eines privaten ChatGPT-Servers nach Unternehmensgröße arbeitet mit Beispielwerten von 80 gleichzeitig laufenden Anfragen in der Spitze. Zwei Server mit je zwei H200 NVL halten rund 220 Gespräche und rund 110, wenn ein Server ausfällt, was die Spitze weiterhin abdeckt. Für 500 Mitarbeiter und eine Spitze von 20 hält eine H200 NVL bereits rund 55, sodass zwei Server mit je einer Karte den Dienst über den Ausfall eines Servers tragen; lassen Sie Steckplätze und Strom für eine zweite Karte je Server frei.

Auf der Entwicklungsseite passen zwei DGX Spark zu einem kleinen Plattformteam. Einer betreibt das Kandidatenmodell hinter vLLM für die Anwendungsentwickler, der andere übernimmt Evaluierungsläufe und Fine-Tuning-Experimente, die auf einem Spark mit dem Serving um denselben Speicher konkurrieren würden. NVIDIAs Produktseite nennt Fine-Tuning „bis zu 70 Milliarden Parameter“, was NVIDIAs Fine-Tuning-Playbook mit QLoRA erreicht, und Inferenz bis 200 Milliarden Parameter auf einem System mit 128 GB, was nach unserer Rechnung nur für 4-Bit-Gewichte gilt. Vier DGX Spark passen, wenn mehrere Teams gleichzeitig Anwendungen bauen oder wenn ein größeres Modell über verbundene Systeme getestet werden muss: NVIDIA nennt bis zu 400 Milliarden Parameter auf zwei Systemen mit 128 GB und bis zu 700 Milliarden auf vier.

Wir liefern die DGX Spark Founders Edition für die Entwicklung und auf Bestellung gebaute KI-Server mit H200 NVL für die Produktion, unter einem EU-Vertrag und auf einer Rechnung. Nennen Sie uns Ihre Mitarbeiterzahl, das Modell und die Zahl der Entwickler, die darauf aufbauen, und wir legen beide Seiten aus.

Was vom DGX Spark auf den H200-NVL-Server mitgeht

vLLM stellt aus seinem HTTP-Server auf beiden Systemen die OpenAI-APIs für Completions und Chat Completions bereit, darunter /v1/chat/completions. Eine Anwendung, die gegen vLLM auf einem Spark gebaut wurde, zeigt danach auf die Adresse des Servers und sendet dieselben Anfragen. Prompts, Evaluierungssätze und RAG-Indizes gehen ebenfalls mit, ebenso Checkpoints in einer Präzision, die beide Systeme ausführen.

NVIDIAs vLLM-Container auf NGC zeigt „Multi-Arch Support“ mit „Yes“; sein neuestes Tag am 28. September 2026 war 26.09-py3, das NVIDIAs Release-Notes als vLLM 0.29.0 auf CUDA 13.4.1 angeben. Die Seite nennt die Architekturen nicht; prüfen Sie deshalb mit docker manifest inspect, ob das Tag sowohl den Arm-Host des Spark als auch den x86-Host des Servers bedient.

NVIDIA NIM führt geprüfte GPUs je Modell. Die Support-Matrix, aktualisiert am 6. Oktober 2026, nennt für gpt-oss-20b, llama-3.1-8b-instruct und nemotron-3-nano sowohl NVIDIA-GB10 als auch NVIDIA-H200-NVL. Für gpt-oss-120b führt sie die H200 NVL und nicht den GB10; ein Team, das dieses Modell in der Produktion als NIM betreiben will, testet es deshalb auf dem Spark mit vLLM und prüft den NIM auf dem Server. NVIDIAs Quickstart für den DGX Spark gibt Zugang zu berechtigten NIM-Containern „über eine Mitgliedschaft im NVIDIA Developer Program oder über NVIDIA AI Enterprise“. NVIDIAs H200-Seite sagt: „Die H200 NVL wird mit einem Fünf-Jahres-Abonnement für NVIDIA AI Enterprise geliefert“, während auf dem DGX Spark der Anspruch „nur besteht, wenn Sie es gekauft, eine Evaluierung angefordert oder ein NVIDIA Entitlement Certificate erhalten haben“.

Was sich ändert: Arm- und x86-Hosts, Compute Capability 12.1 und 9.0

Der DGX Spark betreibt DGX OS auf Basis von Ubuntu 24.04 auf 20 Arm-Kernen, während unsere H200-NVL-Server x86-Prozessoren wie AMD EPYC oder Intel Xeon verwenden. Ihre eigenen Images brauchen Builds für linux/arm64 und linux/amd64, und jedes Python-Paket mit kompilierten Erweiterungen braucht ein Wheel oder einen Build für beide.

NVIDIAs Seite CUDA GPUs führt den GB10 des DGX Spark mit 12.1 und die H200 mit 9.0. NVIDIAs Blackwell-Kompatibilitätsleitfaden hält fest: „Ein für eine bestimmte Compute Capability erzeugtes Cubin wird auf jeder GPU mit derselben Hauptrevision und derselben oder einer höheren Nebenrevision unterstützt“, und PTX läuft nur auf GPUs, deren Compute Capability mindestens der entspricht, die es voraussetzt. Ein eigener Kernel oder eine Erweiterung, auf dem Spark für 12.1 kompiliert, läuft deshalb nicht auf der H200 NVL. Bauen Sie ihn zusätzlich mit dem Ziel 9.0, zum Beispiel -gencode arch=compute_90,code=sm_90, und testen Sie beide Builds in derselben CI-Pipeline.

NVIDIAs vLLM-Release-Notes für 26.09 warnen, dass die Standard-Speicherzuteilung auf Unified Memory wie beim DGX Spark „zu Out-of-Memory-Fehlern führen kann“, und empfehlen --gpu-memory-utilization 0.7. Außerdem verlangen sie --max-num-seqs 4 für Nemotron Nano V3 und Super V3 in NVFP4 auf dem Spark. Eine Produktivkonfiguration setzt beide Werte nach der H200 NVL und der gemessenen Last. NVIDIAs Portierungsleitfaden ergänzt für den DGX Spark: „Die GPUDirect-RDMA-Technologie wird nicht unterstützt“; Storage- und Netzwerkpfade, die darauf aufbauen, lassen sich deshalb nur auf dem Server testen.

FP4 auf dem DGX Spark, FP8 auf der H200 NVL

NVIDIA beschreibt die Tensor-Kerne des DGX Spark als fünfte Generation „mit FP4-Unterstützung“, und NVIDIAs vLLM-Playbook für den Spark stellt einen NVFP4-Checkpoint bereit. Die Produktseite der H200 nennt Tensor-Werte nach unten bis FP8 und INT8 und keinen für FP4. Ein Modell, das auf einem Spark in NVFP4 ausgewählt wurde, kommt auf der H200 NVL meist in FP8 an, was seine Gewichte um rund 70 Prozent vergrößert: NVIDIAs Checkpoints von Llama 4 Scout haben in NVFP4 65,3 GB und in FP8 111,6 GB.

Evaluieren Sie auf dem Spark den Checkpoint, den Sie bereitstellen werden, sofern er passt, damit die Antwortqualität an denselben Gewichten gemessen wird. Qwen3.8-27B läuft in seiner FP8-Version mit 30,9 GB auf einem Spark und auf einer H200 NVL. vLLMs Seite zur Quantisierung, datiert auf den 14. September 2026, markiert seine Marlin-Kernels für „GPTQ/AWQ/FP8/FP4“ als auf Hopper unterstützt, und seine Seite zum Model Optimizer, datiert auf den 2. Oktober 2026, hält fest, dass ohne nativen FP4-Kernel „vLLM auf eine reine Gewichtsausführung (W4A16) über Marlin zurückfällt“. Manche FP4-Checkpoints laden deshalb auf der H200 NVL und sparen dort Speicher, während die Arithmetik in 16 Bit läuft. Unser Artikel zu FP4-Modellen auf H200 NVL und Ada-GPUs behandelt, welche Formate laufen und mit welchen Nachteilen.

500 bis 2.000 Nutzer bedienen: Batching, MIG und NVLink

Ein Produktivdienst bündelt viele Anfragen in einem Durchlauf über die Gewichte, und die Bandbreite der H200 NVL bestimmt, wie schnell jeder Durchlauf sie liest. Die Karte bietet außerdem zwei Funktionen, die dem DGX Spark fehlen. NVIDIAs MIG User Guide führt die H200 NVL mit sieben Instanzen und den GB10 nicht, und die Produktseite nennt „bis zu 7 MIGs mit je 16,5 GB“. Eine Karte kann deshalb das Embedding-Modell und den Reranker eines RAG-Dienstes tragen, neben dem Hauptmodell auf den anderen Karten.

NVLink verbindet zwei oder vier H200 NVL mit 900 GB/s je GPU, sodass sich ein Modell über 141 GB oder sein Cache für lange Kontexte über Karten mit schneller Verbindung verteilen kann. DGX-Spark-Systeme verbinden sich über ConnectX-7 mit 200 Gb/s, rund 25 GB/s.

AUFGABEWO SIE LÄUFTWARUM
Modell auswählenDGX SparkNVIDIA nennt bis zu 200B in 4 Bit auf einem System
Fine-Tuning-ExperimenteDGX SparkNVIDIA nennt bis zu 70B mit QLoRA auf einem System
RAG-Pipeline aufbauenDGX Spark, Multi-Archdieselbe API und dieselben Container wie der Server
Lasttests in der SpitzeH200-NVL-ServerTempo und Batching wie in der Produktion
500 bis 2.000 Mitarbeiterzwei H200-NVL-Server4,8 TB/s je Karte, ein Server kann ausfallen
Lange Kontexte, große LLMsH200 NVL, NVLink2 oder 4 Karten mit 900 GB/s je GPU
Isolierte Instanzen je TeamH200 NVL mit MIGbis zu 7 Instanzen mit je 16,5 GB

Unsere Auswertung von NVIDIAs Produktseiten zu DGX Spark und H200 und des MIG User Guide, Oktober 2026; Serverzahlen aus dem Rechenbeispiel oben.

Bevor wir einen H200-NVL-Server anbieten, prüfen wir Rack, Strom und Luftstrom. Schicken Sie uns über das Formular unten die Stromzuführung am Rackplatz und das Modell, das Sie auf dem DGX Spark getestet haben.

Was wir liefern

Wir liefern die DGX Spark Founders Edition (128 GB) für die Entwicklung und die H200 NVL mit NVLink-Bridges, als Karten oder in nach Auftrag gebauten KI-Servern, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Den Produktivserver legen wir nach Modell, Präzision, Kontextlänge und der Spitzenzahl gleichzeitig laufender Anfragen aus, und Konfiguration und Angebot folgen innerhalb eines Werktages. NVIDIA-AI-Enterprise-Lizenzen kommen auf dieselbe Rechnung wie die Hardware. Unsere Seite zum DGX Spark und unser Sortiment professioneller GPUs nennen die Details, und der Betrieb von Modell, RAG und MLOps auf der Hardware ist unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.

FAQ

DGX Spark vs H200: was ist schneller?
Die H200 NVL ist bei gleichem Modell und gleicher Präzision schneller. Ihre Speicherbandbreite von 4,8 TB/s ist das 17,6-Fache der 273 GB/s des DGX Spark, und die Speicherbandbreite setzt die Obergrenze für die Token-Erzeugung; gemessene Geschwindigkeiten hängen außerdem von Engine und Batchgröße ab. Der DGX Spark hat mit 128 GB Unified Memory mehr Speicher als viele Karten, aber eine H200 NVL hat 141 GB HBM3e allein für die GPU.
Ist der DGX Spark für die Produktion geeignet?
NVIDIA positioniert den DGX Spark für das Prototyping, Testen und Validieren von Modellen, mit einer „späteren Migration“ in Rechenzentrums- oder Cloud-Infrastruktur. Ein Spark kann einen Piloten oder ein kleines Team bedienen, aber für einen Dienst, den 500 bis 2.000 Mitarbeiter nutzen, begrenzt seine Speicherbandbreite von 273 GB/s das Tempo. Zwei H200-NVL-Server tragen diese Last und halten den Dienst am Laufen, wenn einer ausfällt.
DGX Spark oder GPU-Server für die KI-Plattform im Unternehmen?
Ein Unternehmen braucht meist beides, für unterschiedliche Personen. Entwickler bauen und testen auf 2 bis 4 DGX Spark, und der Dienst für die Mitarbeiter läuft auf H200-NVL-Servern, ausgelegt nach der Spitzenzahl gleichzeitig laufender Anfragen. Nach unserer Schätzung halten zwei Server mit je zwei H200 NVL rund 220 Gespräche mit gpt-oss-120b bei 32K.
Wie migriert man vom DGX Spark auf einen H200-NVL-Server?
Behalten Sie die vLLM-API, die Multi-Arch-Container, die Prompts und die Evaluierungssätze, und ändern Sie drei Dinge. Bauen Sie Ihre eigenen Images und CUDA-Erweiterungen neben Arm und 12.1 auch für x86 und Compute Capability 9.0, und ersetzen Sie einen NVFP4-Checkpoint durch einen in FP8. Setzen Sie Speicherauslastung und Parallelität nach der H200 NVL statt nach den Behelfswerten des Spark.
Unterstützt die H200 NVL FP4 wie der DGX Spark?
NVIDIAs Produktseite nennt für die H200 NVL Tensor-Werte bis hinunter zu FP8 und INT8 und keinen für FP4, während der DGX Spark Tensor-Kerne der fünften Generation mit FP4-Unterstützung hat. vLLM lädt manche FP4-Checkpoints auf Hopper über seinen Weight-only-Fallback mit Marlin; das spart Speicher, während die Arithmetik in 16 Bit läuft.
Wie schneidet der Speicher des DGX Spark gegen eine Rechenzentrums-GPU ab?
Der DGX Spark hat 128 GB LPDDR5x mit 273 GB/s, die sich Arm-CPU, Betriebssystem und GPU teilen. Eine H200 NVL hat 141 GB HBM3e mit 4,8 TB/s allein für die GPU. Für die Auslegung setzen wir auf einem DGX Spark (128 GB) 102 GB, rund 95 GiB, für Gewichte und Cache an und auf einer H200 NVL rund 123 GiB.

Schicken Sie uns das Modell, das Sie auf dem DGX Spark testen, seine Präzision, die Kontextlänge, Ihre Mitarbeiterzahl und die Spitzenzahl gleichzeitig laufender Anfragen. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für die DGX-Spark-Systeme und die H200-NVL-Server; Rack, Strom und Luftstrom prüfen wir, bevor wir das Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien