GPU-Speicherbandbreite im Vergleich: HBM3e, GDDR7, GDDR6 und LPDDR5X bei allen Karten, die wir liefern
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Für einen Nutzer ohne spekulatives Decoding ist die Token-Erzeugung durch die Speicherbandbreite geteilt durch die je Token gelesenen Bytes begrenzt, deshalb ordnet die Bandbreite GPUs für die Chat-Geschwindigkeit, bevor die TFLOPS es tun
- H200 NVL: 141 GB HBM3e mit 4,8 TB/s; RTX PRO 6000: 96 GB GDDR7 mit 1.792 GB/s, in der Server Edition 1.597 GB/s; L40S: 48 GB GDDR6 mit 864 GB/s
- RTX PRO 5000 1.344 GB/s, RTX PRO 4500 896 GB/s (Server Edition 800 GB/s), RTX PRO 4000 672 GB/s, RTX PRO 2000 288 GB/s; DGX Spark 273 GB/s LPDDR5x
- GDDR7 läuft auf der RTX PRO 6000 mit 28 Gbit/s je Pin, gegenüber 20 Gbit/s beim GDDR6 der RTX 6000 Ada; je Leistungsklasse erhöht Blackwell die Bandbreite um 29 bis 133 Prozent
- Llama 3.3 70B in FP8 liest etwa 70,6 GB je Token, eine Obergrenze von etwa 68 Token pro Sekunde auf einer H200 NVL und 23 auf einer RTX PRO 6000 Server Edition
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Wie die GPU-Speicherbandbreite die Token pro Sekunde begrenzt
Für jedes Token, das eine GPU erzeugt, muss sie die Gewichte des Modells einmal aus dem GPU-Speicher lesen, dazu die gespeicherten Keys und Values des bisherigen Gesprächs. Für einen Nutzer können die Token pro Sekunde deshalb die Speicherbandbreite geteilt durch die je Token gelesenen Bytes nicht übersteigen, es sei denn, spekulatives Decoding prüft mehrere Token in einem Durchlauf. NVIDIAs Blogbeitrag zur Optimierung der LLM-Inferenz vom 17. November 2023 nennt die Token-Erzeugung „eine speichergebundene Operation“ und hält fest: „Die Geschwindigkeit, mit der die Daten (Gewichte, Keys, Values, Aktivierungen) aus dem Speicher zur GPU übertragen werden, bestimmt die Latenz“.
Damit ist die Speicherbandbreite die erste Zahl, die Sie vergleichen, wenn die Aufgabe Chat, Coding-Assistenten oder Agenten heißt, bei denen Nutzer auf jedes Token warten. Stand Oktober 2026 führt NVIDIA die H200 NVL mit 4,8 TB/s HBM3e. Die RTX PRO 6000 Blackwell hat in der Workstation und der Max-Q Edition 1.792 GB/s GDDR7 und in der Server Edition 1.597 GB/s. Die L40S hat 864 GB/s GDDR6, die L4 300 GB/s und DGX Spark 273 GB/s LPDDR5x.
Der Durchsatz der Tensor-Kerne zählt mehr bei langen Prompts, großen Batches und im Training; das behandelt unser GPU-TFLOPS-Vergleich nach Präzision Karte für Karte.
GPU-Speicherbandbreite im Vergleich: alle Karten, die wir liefern
Die Tabelle gibt die Werte so an, wie NVIDIA sie veröffentlicht; wo NVIDIA keine Busbreite nennt, steht das in der Zelle.
| KARTE | SPEICHER | BUSBREITE | BANDBREITE | DATENRATE JE PIN |
|---|---|---|---|---|
| H200 NVL | 141 GB HBM3e | nicht angegeben | 4.800 GB/s | nicht angegeben |
| RTX PRO 6000 Workstation | 96 GB GDDR7 | 512 Bit | 1.792 GB/s | 28 Gbit/s |
| RTX PRO 6000 Max-Q | 96 GB GDDR7 | 512 Bit | 1.792 GB/s | 28 Gbit/s |
| RTX PRO 6000 Server Edition | 96 GB GDDR7 | 512 Bit | 1.597 GB/s | etwa 25 Gbit/s |
| RTX PRO 5500 (vorläufig) | 84 GB GDDR7 | nicht angegeben | 1.398 GB/s | nicht angegeben |
| RTX PRO 5000 (48 oder 72 GB) | 48 oder 72 GB GDDR7 | 384 Bit | 1.344 GB/s | 28 Gbit/s |
| RTX PRO 4500 | 32 GB GDDR7 | 256 Bit | 896 GB/s | 28 Gbit/s |
| RTX PRO 4500 Server Edition | 32 GB GDDR7 | 256 Bit | 800 GB/s | 25 Gbit/s |
| RTX PRO 4000 | 24 GB GDDR7 | 192 Bit | 672 GB/s | 28 Gbit/s |
| RTX PRO 4000 SFF | 24 GB GDDR7 | 192 Bit | 432 GB/s | 18 Gbit/s |
| RTX PRO 2000 | 16 GB GDDR7 | 128 Bit | 288 GB/s | 18 Gbit/s |
| RTX 6000 Ada | 48 GB GDDR6 | 384 Bit | 960 GB/s | 20 Gbit/s |
| RTX 5880 Ada | 48 GB GDDR6 | 384 Bit | 960 GB/s | 20 Gbit/s |
| RTX 5000 Ada | 32 GB GDDR6 | 256 Bit | 576 GB/s | 18 Gbit/s |
| RTX 4500 Ada | 24 GB GDDR6 | 192 Bit | 432 GB/s | 18 Gbit/s |
| RTX 4000 Ada | 20 GB GDDR6 | 160 Bit | 360 GB/s | 18 Gbit/s |
| RTX 4000 SFF Ada | 20 GB GDDR6 | 160 Bit | 280 GB/s | 14 Gbit/s |
| RTX 2000 Ada | 16 GB GDDR6 | 128 Bit | 224 GB/s | 14 Gbit/s |
| L40S | 48 GB GDDR6 | nicht angegeben | 864 GB/s | nicht angegeben |
| L4 | 24 GB GDDR6 | nicht angegeben | 300 GB/s | nicht angegeben |
| DGX Spark (128 GB) | 128 GB LPDDR5x, Unified Memory | 256 Bit | 273 GB/s | 8.533 MT/s |
NVIDIA-Produktseiten zur H200 (vorläufige Spezifikationen), zur RTX PRO 6000 und 4500 Server Edition, zur RTX PRO 5500 (vorläufig), zur L40S und zur L4, abgerufen am 10. Oktober 2026; NVIDIAs vPC-Sizing-Leitfaden (Speichertyp der L4, aktualisiert am 19. August 2026); NVIDIA-Datenblätter der RTX PRO 6000 Workstation (5349469, Juni 2026), Max-Q (5349650, Juni 2026), RTX PRO 5000 (5349550, Juli 2026), 4500 Workstation Edition (5108623, April 2026), 4000 (5323450, Juni 2026), 4000 SFF (5322500, Juni 2026) und 2000 (5322351, Juni 2026) sowie der RTX-Ada-Karten (2023 und 2024); Benutzerhandbuch des DGX Spark (aktualisiert am 10. September 2026), das „LPDDR5X 8533“ angibt. Die Datenraten von 28 und 20 Gbit/s je Pin für die RTX PRO 6000 und die RTX 6000 Ada stammen aus NVIDIAs Architekturpapier zu RTX Blackwell PRO; die übrigen sind unsere Rechnung, Bandbreite mal 8 geteilt durch die Busbreite.
Die H200 NVL hat die 3,0-fache Bandbreite der RTX PRO 6000 Server Edition und die 5,6-fache der L40S. Nach unserer Rechnung betreibt die Server Edition ihren 512-Bit-Bus mit etwa 25 Gbit/s je Pin, während die Workstation- und die Max-Q-Karte denselben Bus mit 28 Gbit/s betreiben; deshalb hat sie 1.597 statt 1.792 GB/s. Die RTX PRO 4500 Server Edition zeigt dasselbe Muster; für keine der beiden Server Editions nennt NVIDIA eine Datenrate.
NVIDIAs Seite führt die RTX PRO 5500 als „Coming Soon“, mit dem Vermerk „Preliminary product specifications, subject to change“. Für DGX Spark (128 GB) gibt das Benutzerhandbuch „16 channels (256 bit) LPDDR5X 8533“ an; unsere Benchmarks des DGX Spark zeigen, was seine 273 GB/s in gemessenen Token pro Sekunde bedeuten.
GDDR7 vs HBM3e, GDDR6 und LPDDR5X: wie schnell jeder Speichertyp ist
GDDR7 ist der Speicher jeder Karte der Baureihe RTX PRO Blackwell. NVIDIAs Architekturpapier zu RTX Blackwell PRO hält fest, dass die RTX PRO 6000 Workstation und Max-Q Edition „beide mit 96 GB GDDR7-Speicher mit 28 Gbit/s ausgeliefert werden“, und nennt 20 Gbit/s für das GDDR6 der RTX 6000 Ada. Nach unserer Rechnung laufen auch die RTX PRO 5000, 4500 und 4000 mit 28 Gbit/s je Pin und die RTX PRO 4000 SFF und RTX PRO 2000 mit 70 W mit 18 Gbit/s.
Die Bandbreite ist die Datenrate je Pin mal die Busbreite. Die RTX PRO 2000 behält den 128-Bit-Bus der RTX 2000 Ada und gewinnt allein durch den schnelleren Speicher 29 Prozent, 288 gegenüber 224 GB/s. Die RTX PRO 5000 verbindet einen 384-Bit-Bus mit 28 Gbit/s und erreicht 1.344 GB/s, das 2,3-Fache der 576 GB/s der RTX 5000 Ada an einem 256-Bit-Bus. An der Spitze der Baureihe ergeben 512 Bit mit 28 Gbit/s die 1.792 GB/s der RTX PRO 6000, das 1,87-Fache der RTX 6000 Ada.
Für das HBM3e der H200 NVL veröffentlicht NVIDIA weder Busbreite noch Datenrate je Pin, deshalb stehen in diesen Zellen der Tabelle „nicht angegeben“. Für das Sizing zählen die 4,8 TB/s, das 2,7-Fache der 1.792 GB/s der RTX PRO 6000 und das Fünffache der RTX 6000 Ada.
Das LPDDR5X des DGX Spark liefert 273 GB/s aus einer 256-Bit-Schnittstelle mit 8.533 MT/s, etwas weniger als die RTX PRO 2000, aber mit 128 GB Kapazität, die sich CPU und GPU teilen.
Von der Bandbreite zu Token pro Sekunde: die Obergrenze für einen Nutzer
Für ein dichtes Modell und einen Nutzer ist die Obergrenze in Token pro Sekunde die Bandbreite in GB/s geteilt durch die je Token gelesenen GB. Die je Token gelesenen Bytes sind die für dieses Token genutzten Gewichte plus der KV-Cache des bisherigen Gesprächs. Bei einem Mixture-of-Experts-Modell zählen nur die aktiven Experten und die gemeinsamen Layer; deshalb erzeugen solche Modelle schneller Token, als ihre Gesamtgröße vermuten lässt.
Die Bytes der Gewichte ergeben sich aus Parameterzahl und Präzision, wie unser Leitfaden dazu, wie viel VRAM ein LLM braucht, erklärt: FP8 speichert ein Byte je Gewicht, NVFP4 etwas mehr als ein halbes Byte. Halbiert man die Bytes je Gewicht, verdoppelt sich die Obergrenze auf derselben Karte ungefähr. Der KV-Cache wächst mit der Kontextlänge, lange Gespräche senken die Obergrenze also, je länger sie laufen.
Das Ergebnis ist eine obere Schranke, weil auch Kernel, Scheduling und Synchronisation Zeit brauchen; gemessene Geschwindigkeiten liegen deshalb darunter. Mit spekulativem Decoding entwirft die Engine mehrere Token und prüft sie in einem Durchlauf über die Gewichte, sodass die gemessene Geschwindigkeit je Nutzer diesen Wert übersteigen kann. Mit mehreren Nutzern in einem Batch liest jeder Decode-Schritt die Gewichte einmal für alle, den Cache jedes Nutzers aber getrennt; die Geschwindigkeit je Nutzer sinkt dann, während die Gesamtausgabe der Karte steigt, bis die Tensor-Kerne und nicht mehr der Speicher das Tempo bestimmen.
Prefill, das Lesen des Prompts, ist in NVIDIAs Worten „eine Matrix-Matrix-Operation, die stark parallelisiert ist“; lange RAG-Prompts hängen deshalb mehr von der Rechenleistung der Tensor-Kerne ab als vom Speicher, ebenso Training und Fine-Tuning.
Rechenbeispiel: Llama 3.3 70B in FP8 auf drei Karten
NVIDIAs FP8-Checkpoint von Llama 3.3 70B hat 72,7 GB auf der Festplatte. Seine Eingabe-Embedding-Tabelle, 128.256 Token mal 8.192 Werte in 16-Bit-Präzision, belegt etwa 2,1 GB, und je Token wird nur eine Zeile davon gelesen. Nach unserer Rechnung bleiben damit etwa 70,6 GB Gewichte, die für jedes erzeugte Token gelesen werden. Die config.json des Modells nennt 80 Layer, 8 KV-Heads und eine Head-Dimension von 128, und seine Quantisierungskonfiguration legt einen FP8-KV-Cache fest; jedes Token Kontext bringt deshalb 160 KiB hinzu, etwa 5,4 GB für ein Gespräch mit 32.768 Token.
Das Modell passt auf eine H200 NVL oder eine RTX PRO 6000 Server Edition; auf L40S-Karten braucht es zwei, aufgeteilt per Tensor-Parallelismus. Nach der Sizing-Regel unseres VRAM-Leitfadens hat die 96-GB-Karte neben den Gewichten Platz für den Cache von etwa drei Gesprächen mit 32K, die H200 NVL für etwa elf.
| KONFIGURATION | BANDBREITE | KURZER PROMPT | BEI 32K KONTEXT |
|---|---|---|---|
| 1 × H200 NVL | 4.800 GB/s | etwa 68 Tok/s | etwa 63 Tok/s |
| 1 × RTX PRO 6000 Server | 1.597 GB/s | etwa 23 Tok/s | etwa 21 Tok/s |
| 2 × L40S, Tensorparallel | 1.728 GB/s | etwa 24 Tok/s | etwa 23 Tok/s |
| 4 × RTX PRO 6000 Server | 6.388 GB/s | etwa 90 Tok/s | etwa 84 Tok/s |
Unsere Rechnung: Bandbreite von NVIDIAs Produktseiten geteilt durch 70,6 GB Gewichte, bei 32K plus 5,4 GB FP8-KV-Cache; Gewichte und Cache aus NVIDIAs Dateien Llama-3.3-70B-Instruct-FP8 auf Hugging Face, abgerufen am 10. Oktober 2026. Obergrenzen für einen Nutzer, keine gemessenen Geschwindigkeiten; die Zeilen mit mehreren Karten setzen Tensor-Parallelismus voraus und lassen die Zeit für den Datenaustausch zwischen den Karten außer Acht.
Die Obergrenze der H200 NVL ist dreimal so hoch wie die der RTX PRO 6000 Server Edition, weil ihre Bandbreite dreimal so hoch ist; die Rechenleistung der Tensor-Kerne geht in die Rechnung nicht ein. Mit acht Nutzern bei 32K Kontext in einem Batch ergibt dieselbe Rechnung auf der H200 NVL etwa 42 Token pro Sekunde je Nutzer. Eine RTX PRO 6000 Server Edition fasst die 43 GB Cache für diese acht nicht, diese Last braucht also ein Modell, das auf zwei oder mehr Karten aufgeteilt ist. Unser Artikel zu Zielwerten für TTFT und Token pro Sekunde zeigt, wie Sie den Wert je Nutzer festlegen, den ein Chat-Dienst erreichen muss, bevor Sie die Karte wählen.
Wir bauen KI-Server auf Bestellung mit der H200 NVL, der RTX PRO 6000 Server Edition und der L40S. Nennen Sie uns das Modell, seine Präzision und die Zahl Ihrer gleichzeitigen Nutzer, und wir antworten innerhalb eines Werktages mit Konfiguration und Angebot.
Mehrere GPUs in einem Server: wann sich die Bandbreite addiert
Ein Server mit acht Karten hat nach unserer Rechnung mit H200 NVL 38,4 TB/s Speicherbandbreite und mit RTX PRO 6000 Server Edition 12,8 TB/s. Ob ein Nutzer diese Summe sieht, hängt davon ab, wie das Modell auf die Karten verteilt ist.
Mit Replikaten hält jede Karte eine vollständige Kopie des Modells und bedient ihre eigenen Nutzer; die Gesamtausgabe wächst also Karte für Karte, während jeder Nutzer weiterhin die Obergrenze einer Karte erhält. Mit Pipeline-Parallelismus hält jede Karte einen Bereich von Layern, und ein Token durchläuft die Karten nacheinander; jede Karte liest nur ihren Anteil der Gewichte, aber die Lesevorgänge folgen aufeinander, sodass die Obergrenze je Nutzer nahe an der einer Karte mit dem ganzen Modell bleibt. Nur Tensor-Parallelismus teilt jeden Layer auf die Karten auf, sodass alle gleichzeitig ihren Teil der Gewichte jedes Tokens lesen; mit vier Karten steigt die Obergrenze je Nutzer in Richtung des Vierfachen einer Karte.
Tensor-Parallelismus bezahlt das mit Datenverkehr zwischen den Karten bei jedem Layer. NVIDIAs H200-Seite nennt 900 GB/s je GPU über die Zweifach- oder Vierfach-NVLink-Brücke gegenüber 128 GB/s für PCIe Gen5; die RTX PRO 6000 und die L40S tauschen diese Daten über PCIe aus. Diese Verbindungsbandbreite bestimmt, wie viel von der Obergrenze ein aufgeteiltes Modell behält. Unser Vergleich zu einem Modell auf mehreren GPUs über PCIe oder NVLink nennt den Datenverkehr je Token und die passende Parallelisierung je Karte.
Die Speicherkapazität setzt die andere Grenze: Ein Replikat des 70B-Modells auf jeder 96-GB-Karte lässt wenig Platz für den KV-Cache langer Gespräche, während eine Aufteilung auf zwei oder vier Karten auf jeder von ihnen Speicher freimacht.
Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot für einen Server mit vier oder acht Karten erstellen. Beschreiben Sie das Rack, die Modelle und die Nutzerzahl im Formular unten, und wir antworten mit Konfiguration und Angebot.
Was wir liefern
Wir liefern jede Karte aus diesem Vergleich, von der H200 NVL, L40S und L4 bis zu den Baureihen RTX PRO Blackwell und RTX Ada, sowie die DGX Spark Founders Edition. Unser Sortiment professioneller GPUs führt die RTX-PRO- und Rechenzentrumskarten mit ihrer Bandbreite, und unsere nach Auftrag gebauten KI-Server nehmen zwei bis acht der Serverkarten auf, mit Konfiguration und Angebot innerhalb eines Werktages. Die Server werden montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung, unter einem EU-Vertrag.
FAQ
Wie hoch ist die Speicherbandbreite der H200 NVL?
Welche Bandbreite hat die RTX PRO 4000 Blackwell?
Welche Speicherbandbreite hat die RTX PRO 6000?
Wie schnell ist GDDR7 im Vergleich zu HBM3e?
Wie hängen Speicherbandbreite und Token pro Sekunde zusammen?
Wie schneidet die Speicherbandbreite des DGX Spark gegenüber RTX-PRO-Karten ab?
Schicken Sie uns das Modell, seine Präzision, die Zahl gleichzeitiger Nutzer, die geplante Kontextlänge und das Rack, in das die Server kommen. Wir antworten innerhalb eines Werktages mit den Karten und der Kartenzahl, die wir einsetzen würden, sowie mit einer Konfiguration und einem Angebot.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages