BLOG · VERGLEICH ·

GPU-Speicherbandbreite im Vergleich: HBM3e, GDDR7, GDDR6 und LPDDR5X bei allen Karten, die wir liefern

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Für einen Nutzer ohne spekulatives Decoding ist die Token-Erzeugung durch die Speicherbandbreite geteilt durch die je Token gelesenen Bytes begrenzt, deshalb ordnet die Bandbreite GPUs für die Chat-Geschwindigkeit, bevor die TFLOPS es tun
  • H200 NVL: 141 GB HBM3e mit 4,8 TB/s; RTX PRO 6000: 96 GB GDDR7 mit 1.792 GB/s, in der Server Edition 1.597 GB/s; L40S: 48 GB GDDR6 mit 864 GB/s
  • RTX PRO 5000 1.344 GB/s, RTX PRO 4500 896 GB/s (Server Edition 800 GB/s), RTX PRO 4000 672 GB/s, RTX PRO 2000 288 GB/s; DGX Spark 273 GB/s LPDDR5x
  • GDDR7 läuft auf der RTX PRO 6000 mit 28 Gbit/s je Pin, gegenüber 20 Gbit/s beim GDDR6 der RTX 6000 Ada; je Leistungsklasse erhöht Blackwell die Bandbreite um 29 bis 133 Prozent
  • Llama 3.3 70B in FP8 liest etwa 70,6 GB je Token, eine Obergrenze von etwa 68 Token pro Sekunde auf einer H200 NVL und 23 auf einer RTX PRO 6000 Server Edition

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Wie die GPU-Speicherbandbreite die Token pro Sekunde begrenzt

Für jedes Token, das eine GPU erzeugt, muss sie die Gewichte des Modells einmal aus dem GPU-Speicher lesen, dazu die gespeicherten Keys und Values des bisherigen Gesprächs. Für einen Nutzer können die Token pro Sekunde deshalb die Speicherbandbreite geteilt durch die je Token gelesenen Bytes nicht übersteigen, es sei denn, spekulatives Decoding prüft mehrere Token in einem Durchlauf. NVIDIAs Blogbeitrag zur Optimierung der LLM-Inferenz vom 17. November 2023 nennt die Token-Erzeugung „eine speichergebundene Operation“ und hält fest: „Die Geschwindigkeit, mit der die Daten (Gewichte, Keys, Values, Aktivierungen) aus dem Speicher zur GPU übertragen werden, bestimmt die Latenz“.

Damit ist die Speicherbandbreite die erste Zahl, die Sie vergleichen, wenn die Aufgabe Chat, Coding-Assistenten oder Agenten heißt, bei denen Nutzer auf jedes Token warten. Stand Oktober 2026 führt NVIDIA die H200 NVL mit 4,8 TB/s HBM3e. Die RTX PRO 6000 Blackwell hat in der Workstation und der Max-Q Edition 1.792 GB/s GDDR7 und in der Server Edition 1.597 GB/s. Die L40S hat 864 GB/s GDDR6, die L4 300 GB/s und DGX Spark 273 GB/s LPDDR5x.

Der Durchsatz der Tensor-Kerne zählt mehr bei langen Prompts, großen Batches und im Training; das behandelt unser GPU-TFLOPS-Vergleich nach Präzision Karte für Karte.

GPU-Speicherbandbreite im Vergleich: alle Karten, die wir liefern

Die Tabelle gibt die Werte so an, wie NVIDIA sie veröffentlicht; wo NVIDIA keine Busbreite nennt, steht das in der Zelle.

KARTESPEICHERBUSBREITEBANDBREITEDATENRATE JE PIN
H200 NVL141 GB HBM3enicht angegeben4.800 GB/snicht angegeben
RTX PRO 6000 Workstation96 GB GDDR7512 Bit1.792 GB/s28 Gbit/s
RTX PRO 6000 Max-Q96 GB GDDR7512 Bit1.792 GB/s28 Gbit/s
RTX PRO 6000 Server Edition96 GB GDDR7512 Bit1.597 GB/setwa 25 Gbit/s
RTX PRO 5500 (vorläufig)84 GB GDDR7nicht angegeben1.398 GB/snicht angegeben
RTX PRO 5000 (48 oder 72 GB)48 oder 72 GB GDDR7384 Bit1.344 GB/s28 Gbit/s
RTX PRO 450032 GB GDDR7256 Bit896 GB/s28 Gbit/s
RTX PRO 4500 Server Edition32 GB GDDR7256 Bit800 GB/s25 Gbit/s
RTX PRO 400024 GB GDDR7192 Bit672 GB/s28 Gbit/s
RTX PRO 4000 SFF24 GB GDDR7192 Bit432 GB/s18 Gbit/s
RTX PRO 200016 GB GDDR7128 Bit288 GB/s18 Gbit/s
RTX 6000 Ada48 GB GDDR6384 Bit960 GB/s20 Gbit/s
RTX 5880 Ada48 GB GDDR6384 Bit960 GB/s20 Gbit/s
RTX 5000 Ada32 GB GDDR6256 Bit576 GB/s18 Gbit/s
RTX 4500 Ada24 GB GDDR6192 Bit432 GB/s18 Gbit/s
RTX 4000 Ada20 GB GDDR6160 Bit360 GB/s18 Gbit/s
RTX 4000 SFF Ada20 GB GDDR6160 Bit280 GB/s14 Gbit/s
RTX 2000 Ada16 GB GDDR6128 Bit224 GB/s14 Gbit/s
L40S48 GB GDDR6nicht angegeben864 GB/snicht angegeben
L424 GB GDDR6nicht angegeben300 GB/snicht angegeben
DGX Spark (128 GB)128 GB LPDDR5x, Unified Memory256 Bit273 GB/s8.533 MT/s

NVIDIA-Produktseiten zur H200 (vorläufige Spezifikationen), zur RTX PRO 6000 und 4500 Server Edition, zur RTX PRO 5500 (vorläufig), zur L40S und zur L4, abgerufen am 10. Oktober 2026; NVIDIAs vPC-Sizing-Leitfaden (Speichertyp der L4, aktualisiert am 19. August 2026); NVIDIA-Datenblätter der RTX PRO 6000 Workstation (5349469, Juni 2026), Max-Q (5349650, Juni 2026), RTX PRO 5000 (5349550, Juli 2026), 4500 Workstation Edition (5108623, April 2026), 4000 (5323450, Juni 2026), 4000 SFF (5322500, Juni 2026) und 2000 (5322351, Juni 2026) sowie der RTX-Ada-Karten (2023 und 2024); Benutzerhandbuch des DGX Spark (aktualisiert am 10. September 2026), das „LPDDR5X 8533“ angibt. Die Datenraten von 28 und 20 Gbit/s je Pin für die RTX PRO 6000 und die RTX 6000 Ada stammen aus NVIDIAs Architekturpapier zu RTX Blackwell PRO; die übrigen sind unsere Rechnung, Bandbreite mal 8 geteilt durch die Busbreite.

Die H200 NVL hat die 3,0-fache Bandbreite der RTX PRO 6000 Server Edition und die 5,6-fache der L40S. Nach unserer Rechnung betreibt die Server Edition ihren 512-Bit-Bus mit etwa 25 Gbit/s je Pin, während die Workstation- und die Max-Q-Karte denselben Bus mit 28 Gbit/s betreiben; deshalb hat sie 1.597 statt 1.792 GB/s. Die RTX PRO 4500 Server Edition zeigt dasselbe Muster; für keine der beiden Server Editions nennt NVIDIA eine Datenrate.

NVIDIAs Seite führt die RTX PRO 5500 als „Coming Soon“, mit dem Vermerk „Preliminary product specifications, subject to change“. Für DGX Spark (128 GB) gibt das Benutzerhandbuch „16 channels (256 bit) LPDDR5X 8533“ an; unsere Benchmarks des DGX Spark zeigen, was seine 273 GB/s in gemessenen Token pro Sekunde bedeuten.

GDDR7 vs HBM3e, GDDR6 und LPDDR5X: wie schnell jeder Speichertyp ist

GDDR7 ist der Speicher jeder Karte der Baureihe RTX PRO Blackwell. NVIDIAs Architekturpapier zu RTX Blackwell PRO hält fest, dass die RTX PRO 6000 Workstation und Max-Q Edition „beide mit 96 GB GDDR7-Speicher mit 28 Gbit/s ausgeliefert werden“, und nennt 20 Gbit/s für das GDDR6 der RTX 6000 Ada. Nach unserer Rechnung laufen auch die RTX PRO 5000, 4500 und 4000 mit 28 Gbit/s je Pin und die RTX PRO 4000 SFF und RTX PRO 2000 mit 70 W mit 18 Gbit/s.

Die Bandbreite ist die Datenrate je Pin mal die Busbreite. Die RTX PRO 2000 behält den 128-Bit-Bus der RTX 2000 Ada und gewinnt allein durch den schnelleren Speicher 29 Prozent, 288 gegenüber 224 GB/s. Die RTX PRO 5000 verbindet einen 384-Bit-Bus mit 28 Gbit/s und erreicht 1.344 GB/s, das 2,3-Fache der 576 GB/s der RTX 5000 Ada an einem 256-Bit-Bus. An der Spitze der Baureihe ergeben 512 Bit mit 28 Gbit/s die 1.792 GB/s der RTX PRO 6000, das 1,87-Fache der RTX 6000 Ada.

Für das HBM3e der H200 NVL veröffentlicht NVIDIA weder Busbreite noch Datenrate je Pin, deshalb stehen in diesen Zellen der Tabelle „nicht angegeben“. Für das Sizing zählen die 4,8 TB/s, das 2,7-Fache der 1.792 GB/s der RTX PRO 6000 und das Fünffache der RTX 6000 Ada.

Das LPDDR5X des DGX Spark liefert 273 GB/s aus einer 256-Bit-Schnittstelle mit 8.533 MT/s, etwas weniger als die RTX PRO 2000, aber mit 128 GB Kapazität, die sich CPU und GPU teilen.

Von der Bandbreite zu Token pro Sekunde: die Obergrenze für einen Nutzer

Für ein dichtes Modell und einen Nutzer ist die Obergrenze in Token pro Sekunde die Bandbreite in GB/s geteilt durch die je Token gelesenen GB. Die je Token gelesenen Bytes sind die für dieses Token genutzten Gewichte plus der KV-Cache des bisherigen Gesprächs. Bei einem Mixture-of-Experts-Modell zählen nur die aktiven Experten und die gemeinsamen Layer; deshalb erzeugen solche Modelle schneller Token, als ihre Gesamtgröße vermuten lässt.

Die Bytes der Gewichte ergeben sich aus Parameterzahl und Präzision, wie unser Leitfaden dazu, wie viel VRAM ein LLM braucht, erklärt: FP8 speichert ein Byte je Gewicht, NVFP4 etwas mehr als ein halbes Byte. Halbiert man die Bytes je Gewicht, verdoppelt sich die Obergrenze auf derselben Karte ungefähr. Der KV-Cache wächst mit der Kontextlänge, lange Gespräche senken die Obergrenze also, je länger sie laufen.

Das Ergebnis ist eine obere Schranke, weil auch Kernel, Scheduling und Synchronisation Zeit brauchen; gemessene Geschwindigkeiten liegen deshalb darunter. Mit spekulativem Decoding entwirft die Engine mehrere Token und prüft sie in einem Durchlauf über die Gewichte, sodass die gemessene Geschwindigkeit je Nutzer diesen Wert übersteigen kann. Mit mehreren Nutzern in einem Batch liest jeder Decode-Schritt die Gewichte einmal für alle, den Cache jedes Nutzers aber getrennt; die Geschwindigkeit je Nutzer sinkt dann, während die Gesamtausgabe der Karte steigt, bis die Tensor-Kerne und nicht mehr der Speicher das Tempo bestimmen.

Prefill, das Lesen des Prompts, ist in NVIDIAs Worten „eine Matrix-Matrix-Operation, die stark parallelisiert ist“; lange RAG-Prompts hängen deshalb mehr von der Rechenleistung der Tensor-Kerne ab als vom Speicher, ebenso Training und Fine-Tuning.

Rechenbeispiel: Llama 3.3 70B in FP8 auf drei Karten

NVIDIAs FP8-Checkpoint von Llama 3.3 70B hat 72,7 GB auf der Festplatte. Seine Eingabe-Embedding-Tabelle, 128.256 Token mal 8.192 Werte in 16-Bit-Präzision, belegt etwa 2,1 GB, und je Token wird nur eine Zeile davon gelesen. Nach unserer Rechnung bleiben damit etwa 70,6 GB Gewichte, die für jedes erzeugte Token gelesen werden. Die config.json des Modells nennt 80 Layer, 8 KV-Heads und eine Head-Dimension von 128, und seine Quantisierungskonfiguration legt einen FP8-KV-Cache fest; jedes Token Kontext bringt deshalb 160 KiB hinzu, etwa 5,4 GB für ein Gespräch mit 32.768 Token.

Das Modell passt auf eine H200 NVL oder eine RTX PRO 6000 Server Edition; auf L40S-Karten braucht es zwei, aufgeteilt per Tensor-Parallelismus. Nach der Sizing-Regel unseres VRAM-Leitfadens hat die 96-GB-Karte neben den Gewichten Platz für den Cache von etwa drei Gesprächen mit 32K, die H200 NVL für etwa elf.

KONFIGURATIONBANDBREITEKURZER PROMPTBEI 32K KONTEXT
1 × H200 NVL4.800 GB/setwa 68 Tok/setwa 63 Tok/s
1 × RTX PRO 6000 Server1.597 GB/setwa 23 Tok/setwa 21 Tok/s
2 × L40S, Tensor­parallel1.728 GB/setwa 24 Tok/setwa 23 Tok/s
4 × RTX PRO 6000 Server6.388 GB/setwa 90 Tok/setwa 84 Tok/s

Unsere Rechnung: Bandbreite von NVIDIAs Produktseiten geteilt durch 70,6 GB Gewichte, bei 32K plus 5,4 GB FP8-KV-Cache; Gewichte und Cache aus NVIDIAs Dateien Llama-3.3-70B-Instruct-FP8 auf Hugging Face, abgerufen am 10. Oktober 2026. Obergrenzen für einen Nutzer, keine gemessenen Geschwindigkeiten; die Zeilen mit mehreren Karten setzen Tensor-Parallelismus voraus und lassen die Zeit für den Datenaustausch zwischen den Karten außer Acht.

Die Obergrenze der H200 NVL ist dreimal so hoch wie die der RTX PRO 6000 Server Edition, weil ihre Bandbreite dreimal so hoch ist; die Rechenleistung der Tensor-Kerne geht in die Rechnung nicht ein. Mit acht Nutzern bei 32K Kontext in einem Batch ergibt dieselbe Rechnung auf der H200 NVL etwa 42 Token pro Sekunde je Nutzer. Eine RTX PRO 6000 Server Edition fasst die 43 GB Cache für diese acht nicht, diese Last braucht also ein Modell, das auf zwei oder mehr Karten aufgeteilt ist. Unser Artikel zu Zielwerten für TTFT und Token pro Sekunde zeigt, wie Sie den Wert je Nutzer festlegen, den ein Chat-Dienst erreichen muss, bevor Sie die Karte wählen.

Wir bauen KI-Server auf Bestellung mit der H200 NVL, der RTX PRO 6000 Server Edition und der L40S. Nennen Sie uns das Modell, seine Präzision und die Zahl Ihrer gleichzeitigen Nutzer, und wir antworten innerhalb eines Werktages mit Konfiguration und Angebot.

Mehrere GPUs in einem Server: wann sich die Bandbreite addiert

Ein Server mit acht Karten hat nach unserer Rechnung mit H200 NVL 38,4 TB/s Speicherbandbreite und mit RTX PRO 6000 Server Edition 12,8 TB/s. Ob ein Nutzer diese Summe sieht, hängt davon ab, wie das Modell auf die Karten verteilt ist.

Mit Replikaten hält jede Karte eine vollständige Kopie des Modells und bedient ihre eigenen Nutzer; die Gesamtausgabe wächst also Karte für Karte, während jeder Nutzer weiterhin die Obergrenze einer Karte erhält. Mit Pipeline-Parallelismus hält jede Karte einen Bereich von Layern, und ein Token durchläuft die Karten nacheinander; jede Karte liest nur ihren Anteil der Gewichte, aber die Lesevorgänge folgen aufeinander, sodass die Obergrenze je Nutzer nahe an der einer Karte mit dem ganzen Modell bleibt. Nur Tensor-Parallelismus teilt jeden Layer auf die Karten auf, sodass alle gleichzeitig ihren Teil der Gewichte jedes Tokens lesen; mit vier Karten steigt die Obergrenze je Nutzer in Richtung des Vierfachen einer Karte.

Tensor-Parallelismus bezahlt das mit Datenverkehr zwischen den Karten bei jedem Layer. NVIDIAs H200-Seite nennt 900 GB/s je GPU über die Zweifach- oder Vierfach-NVLink-Brücke gegenüber 128 GB/s für PCIe Gen5; die RTX PRO 6000 und die L40S tauschen diese Daten über PCIe aus. Diese Verbindungsbandbreite bestimmt, wie viel von der Obergrenze ein aufgeteiltes Modell behält. Unser Vergleich zu einem Modell auf mehreren GPUs über PCIe oder NVLink nennt den Datenverkehr je Token und die passende Parallelisierung je Karte.

Die Speicherkapazität setzt die andere Grenze: Ein Replikat des 70B-Modells auf jeder 96-GB-Karte lässt wenig Platz für den KV-Cache langer Gespräche, während eine Aufteilung auf zwei oder vier Karten auf jeder von ihnen Speicher freimacht.

Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot für einen Server mit vier oder acht Karten erstellen. Beschreiben Sie das Rack, die Modelle und die Nutzerzahl im Formular unten, und wir antworten mit Konfiguration und Angebot.

Was wir liefern

Wir liefern jede Karte aus diesem Vergleich, von der H200 NVL, L40S und L4 bis zu den Baureihen RTX PRO Blackwell und RTX Ada, sowie die DGX Spark Founders Edition. Unser Sortiment professioneller GPUs führt die RTX-PRO- und Rechenzentrumskarten mit ihrer Bandbreite, und unsere nach Auftrag gebauten KI-Server nehmen zwei bis acht der Serverkarten auf, mit Konfiguration und Angebot innerhalb eines Werktages. Die Server werden montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung, unter einem EU-Vertrag.

FAQ

Wie hoch ist die Speicherbandbreite der H200 NVL?
NVIDIA führt die H200 NVL mit 141 GB HBM3e und 4,8 TB/s, derselben Bandbreite wie die H200 SXM. Das ist das 3,0-Fache der 1.597 GB/s der RTX PRO 6000 Server Edition und das 5,6-Fache der 864 GB/s der L40S.
Welche Bandbreite hat die RTX PRO 4000 Blackwell?
Die RTX PRO 4000 Blackwell hat laut NVIDIAs Datenblatt vom Juni 2026 24 GB GDDR7 an einem 192-Bit-Bus mit 672 GB/s. Die RTX PRO 4000 SFF hat dieselben 24 GB und denselben Bus mit 432 GB/s, und die RTX 4000 Ada, die sie ersetzt, hat 360 GB/s.
Welche Speicherbandbreite hat die RTX PRO 6000?
Die RTX PRO 6000 Blackwell hat als Workstation und Max-Q Edition 96 GB GDDR7 an einem 512-Bit-Bus mit 1.792 GB/s. Die Server Edition hat denselben Speicher und Bus mit 1.597 GB/s, wie NVIDIA auf ihrer Produktseite angibt.
Wie schnell ist GDDR7 im Vergleich zu HBM3e?
NVIDIA nennt für das GDDR7 der RTX PRO 6000 28 Gbit/s je Pin, was an ihrem 512-Bit-Bus 1.792 GB/s ergibt. Das HBM3e der H200 NVL erreicht 4,8 TB/s, das 2,7-Fache; Busbreite und Datenrate je Pin dieses Speichers veröffentlicht NVIDIA nicht.
Wie hängen Speicherbandbreite und Token pro Sekunde zusammen?
Für einen Nutzer liest jedes erzeugte Token die Gewichte des Modells und den KV-Cache einmal, deshalb können die Token pro Sekunde ohne spekulatives Decoding die Bandbreite geteilt durch die je Token gelesenen Bytes nicht übersteigen. Für Llama 3.3 70B in FP8, etwa 70,6 GB je Token, ergibt das Obergrenzen von etwa 68 Token pro Sekunde auf einer H200 NVL und 23 auf einer RTX PRO 6000 Server Edition; gemessene Geschwindigkeiten liegen darunter.
Wie schneidet die Speicherbandbreite des DGX Spark gegenüber RTX-PRO-Karten ab?
DGX Spark (128 GB) hat 273 GB/s LPDDR5x Unified Memory an einer 256-Bit-Schnittstelle, etwas weniger als die 288 GB/s der RTX PRO 2000 und weit weniger als die 1.792 GB/s der RTX PRO 6000. Seine 128 GB, die sich CPU und GPU teilen, laden Modelle, die auf keine RTX-PRO-Karte unterhalb der 6000 passen.

Schicken Sie uns das Modell, seine Präzision, die Zahl gleichzeitiger Nutzer, die geplante Kontextlänge und das Rack, in das die Server kommen. Wir antworten innerhalb eines Werktages mit den Karten und der Kartenzahl, die wir einsetzen würden, sowie mit einer Konfiguration und einem Angebot.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien