NVIDIA RTX PRO 6000 Blackwell: was die veröffentlichten Benchmarks zeigen und welche Grenzen das Datenblatt auslässt
- In MLPerf® Inference: Datacenter v6.0 (Closed Division, Eintrag 6.0-0047, abgerufen von mlcommons.org am 24. September 2026, Ergebnis von der MLCommons Association verifiziert) erreichte HPEs ProLiant Compute DL380a Gen12 mit acht Karten der Server Edition 29.908,4 Token pro Sekunde mit Llama 2 70B, Variante mit 99 Prozent Genauigkeit, im Offline-Szenario, mit FP4-Gewichten
- StorageReview maß 163,15 Token pro Sekunde für eine einzelne Anfrage an gpt-oss-120b auf einer Workstation Edition in LM Studio und 32,89 Token pro Sekunde je Nutzer für Llama 2 70B Chat auf vier Karten der Server Edition mit vLLM bei TP=4
- NVIDIAs Tabelle zu TensorRT-LLM nennt für eine Server Edition 1.724 Ausgabe-Token pro Sekunde mit Llama 3.3 70B in FP4 unter Volllast bei Prompts mit 1.000 Token und 296 bei Prompts mit 8.192 Token
- Für einen einzelnen Nutzer begrenzt die Speicherbandbreite ein 70B-Modell in FP8 auf 25,4 Token pro Sekunde bei der Workstation Edition und der Max-Q (1.792 GB/s) und auf 22,6 bei der Server Edition (1.597 GB/s), nach unserer Rechnung
- Puget Systems maß die Workstation Edition in Blender 50 Prozent vor der RTX 6000 Ada, mit nahezu gleichen Zuwächsen im RTX-Modus von V-Ray und 55 Prozent in dessen CUDA-Modus, und die Max-Q mit 300 W um 5 bis 14 Prozent hinter der Workstation Edition
Drei Editionen, ein Chip
Hinter dem Namen RTX PRO 6000 Blackwell stecken drei Karten mit demselben Chip, dem GB202: 24.064 CUDA-Kerne und 96 GB GDDR7 mit ECC an einem 512-Bit-Bus, von denen nvidia-smi 97.887 MiB meldet, also 95,6 GiB. Die Workstation Edition läuft mit 600 W, einem Double-Flow-Through-Kühler und 1.792 GB/s; die Max-Q behält diesen Speicher und diese Bandbreite bei 300 W, mit einem Kühler in Radialgebläse-Bauart, wie Puget Systems ihn beschreibt; die passive Server Edition nimmt bis zu 600 W auf, konfigurierbar, und ihr Speicher läuft mit 1.597 GB/s. Unser Editionsvergleich enthält die vollständige Tabelle.
Wir sind Lieferant, kein Labor: Nichts in diesem Artikel ist eine eigene Messung. Jeder Messwert ist ein veröffentlichtes Ergebnis Dritter, zitiert mit Quelle, Datum und, soweit angegeben, Modell, Präzision und Software.
Die Obergrenze: Bandbreite geteilt durch Bytes
Die Prefill-Phase ist rechenlimitiert; die Decode-Phase liest jedes aktive Gewicht einmal pro Token, für einen Nutzer ist die Grenze also die Speicherbandbreite geteilt durch die pro Token gelesenen Bytes. Nach unserer Rechnung liest Llama 3.3 70B pro Token 70,6 GB in FP8 und 40,6 GB in NVFP4, was einen einzelnen Stream bei der Workstation Edition und der Max-Q auf 25,4 und 44,1 Token pro Sekunde begrenzt und bei der Server Edition auf 22,6 und 39,3; gpt-oss-120b, mit etwa 5 GB pro Token im MXFP4-Checkpoint von OpenAI, auf rund 360 und 320. Das sind Obergrenzen für gewöhnliches Decoding, keine Messungen.
Bei vielen gleichzeitigen Anfragen bedient jeder Lesedurchgang der Gewichte alle Anfragen zugleich, der Gesamtdurchsatz steigt also, bis die Rechenleistung oder der Platz für den KV-Cache ausgeht; an dieser Stelle zählen die FP4-Tensor-Kerne.
NVIDIAs eigene Zahlen: Durchsatz unter Volllast
NVIDIAs Performance-Übersicht zu TensorRT-LLM enthält für die Server Edition Tabellen zu drei Modellen, jeweils aus einem FP4-Checkpoint von NVIDIA. Die Metrik ist Ausgabe-Token pro Sekunde je GPU, das erste Token eingeschlossen, gemessen mit trtllm-bench und dem PyTorch-Backend, während ein lokaler Client Anfragen „mit hoher Rate / ohne Verzögerung zwischen den Nachrichten“ sendet: eine Karte unter maximaler Last, mit vielen Optionen in der Standardeinstellung, in Zahlen, die laut NVIDIA „nicht als Spitzenleistung betrachtet werden sollten“.
| MODELL, PRÄZISION | GPUS | EINGABE / AUSGABE | TOK/S JE GPU |
|---|---|---|---|
| Llama 3.3 70B, FP4 | 1 | 1.000 / 1.000 | 1.724 |
| Llama 3.3 70B, FP4 | 1 | 8.192 / 1.024 | 296 |
| Llama 3.3 70B, FP4 | 2, pipeline-parallel | 32.768 / 1.024 | 67 |
| Qwen3-30B-A3B, FP4 | 1 | 1.000 / 1.000 | 9.938 |
| Qwen3-30B-A3B, FP4 | 1 | 32.768 / 1.024 | 374 |
| Qwen3-235B-A22B, FP4 | 4 | 1.000 / 1.000 | 1.731 |
Performance-Übersicht von NVIDIA zu TensorRT-LLM, Tabellen für die „RTX 6000 Pro Blackwell Server Edition“, zuletzt aktualisiert am 21. September 2026; synthetische Prompts, Eingabe- und Ausgabelängen in Token. Der Eintrag für Qwen3-235B-A22B mit vier Karten nutzt NVIDIAs Einstellungen DEP2 und PP2.
Am stärksten beeinflusst die Prompt-Länge das Ergebnis: Das 70B-Modell fällt von 1.724 auf 296 Token pro Sekunde je GPU, wenn die Prompts von 1.000 auf 8.192 Token wachsen, und Prompts mit 32.768 Token führt NVIDIA für dieses Modell nur auf zwei Karten, pipeline-parallel. Wir haben bei NVIDIA keine Angabe je Nutzer gefunden.
MLPerf® Inference v6.0: verifizierte Ergebnisse für zwei bis zehn Karten
MLPerf Inference v6.0 enthält Ergebnisse der Closed Division von HPE, Dell, Cisco und weiteren Einreichern für Server mit zwei bis zehn Karten der Server Edition; der Server mit zehn Karten ist HPEs ProLiant Compute DL380a Gen12 (Eintrag 6.0-0045). Im Offline-Szenario werden alle Anfragen auf einmal gesendet; im Server-Szenario treffen sie in zufälligen Abständen ein, und ein Lauf zählt nur, wenn die Zeit bis zum ersten Token und die Zeit je Ausgabe-Token innerhalb von Grenzwerten bleiben, die das Interactive-Szenario verschärft. MLPerf Inference v6.1, veröffentlicht am 16. September 2026, enthält ebenfalls Systeme mit der Server Edition; dieser Artikel zitiert nur Ergebnisse aus v6.0.
| BENCHMARK, SZENARIO | ID, SYSTEM, KARTEN | TOKEN/S | JE KARTE (UNSERE) |
|---|---|---|---|
| Llama 2 70B, Offline | 6.0-0052, HPE DL385 Gen11, 2 | 6.901,9 | 3.451 |
| Llama 2 70B, Offline | 6.0-0054, HPE DL385 Gen11, 4 mit 450 W | 13.361,9 | 3.340 |
| Llama 2 70B, Offline | 6.0-0047, HPE DL380a Gen12, 8 | 29.908,4 | 3.739 |
| Llama 2 70B, Server | 6.0-0047, HPE DL380a Gen12, 8 | 28.727,8 | 3.591 |
| Llama 2 70B, Interactive | 6.0-0004, 8 Karten | 6.238,1 | 780 |
| Llama 2 70B, Interactive | 6.0-0005, 8 Karten | 6.262,6 | 783 |
| gpt-oss-120b, Offline | 6.0-0047, HPE DL380a Gen12, 8 | 15.189,9 | 1.899 |
| gpt-oss-120b, Server | 6.0-0047, HPE DL380a Gen12, 8 | 14.258,9 | 1.782 |
MLPerf Inference: Datacenter v6.0 (veröffentlicht am 1. April 2026), Closed Division, Kategorie Available; Benchmarks Llama 2 70B (llama2-70b-99) und gpt-oss-120b, Szenarien Offline, Server und Interactive; abgerufen von mlcommons.org am 24. September 2026; Ergebnisse von der MLCommons Association verifiziert, wie jedes MLPerf-Ergebnis in diesem Abschnitt. Werte aus der Ergebnistabelle und den Rohlogs von MLCommons; die Systeme mit der RTX PRO 6000 liefen mit FP4-Gewichten auf TensorRT 10.14 mit CUDA 13.0 oder 13.1. Die Werte je Karte (unsere Division des Systemergebnisses durch die Zahl seiner GPUs) und die Token pro Sekunde je Stream (1.000 geteilt durch die mediane Zeit je Ausgabe-Token im Log) sind unsere Rechnung, keine MLPerf-Metriken. Grenzen für das erste Token und je Ausgabe-Token: Server 2 s und 200 ms für Llama 2 70B, 3 s und 80 ms für gpt-oss-120b; Interactive 450 ms und 40 ms. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information.
Nach unserer Division jedes Systemergebnisses, keine MLPerf-Metrik, erreichten die drei HPE-Systeme der Tabelle mit Llama 2 70B im Offline-Szenario 3.340 bis 3.739 Token pro Sekunde je Karte. HPEs Server mit acht Karten behielt im Server-Szenario 96 Prozent seines Offline-Gesamtwerts, mit einem Median von 175 ms je Ausgabe-Token: etwa 5,7 Token pro Sekunde für den Median-Stream, nach unserer Rechnung. Das Interactive-Szenario bildet das Chat-Tempo ab: Die Server der Ergebnisse 6.0-0004 und 6.0-0005 mit je acht Karten hielten den Median-Stream bei etwa 27 Token pro Sekunde (37 ms je Token) und lieferten 6.238,1 und 6.262,6 Token pro Sekunde, 22 und 23 Prozent ihrer eigenen Offline-Ergebnisse (27.812,9 und 27.730,1). Bei gpt-oss-120b lag der Median im Server-Szenario bei 55 ms je Token, etwa 18 Token pro Sekunde je Stream. NVIDIAs 1.724 je GPU und unsere Division der MLPerf-Ergebnisse je Karte sind unterschiedliche Messungen: Modelle, Anfragelängen, Software und Tuning unterscheiden sich allesamt.
HPEs DL385 Gen11 mit vier Karten (Eintrag 6.0-0054) begrenzte seine Karten auf 450 W, während das System mit zwei Karten (Eintrag 6.0-0052) sie mit 600 W betrieb. Nach derselben Division je Karte, keine MLPerf-Metrik, lieferten die begrenzten Karten im Offline-Szenario 3 Prozent weniger und im Server-Szenario 8 Prozent weniger, in dem ein Ergebnis auch von der Last abhängt, auf die der jeweilige Lauf eingestellt war. Die beiden Systeme unterscheiden sich in der Kartenzahl und im Treiber-Build (580.105.09 gegenüber 580.126.09), das ist also ein Anhaltspunkt, kein kontrollierter Test.
Dells PowerEdge XE7740 mit acht H200 NVL (Eintrag 6.0-0021) lieferte mit Llama 2 70B im Offline-Szenario 18 Prozent mehr als dasselbe Chassis mit acht RTX PRO 6000 (Eintrag 6.0-0022), 32.004 gegenüber 27.034,8 Token pro Sekunde; das H200-NVL-System lief mit FP8-Gewichten auf TensorRT 10.13, wobei NVLink als Verbindung zwischen den Karten angegeben ist, das RTX-PRO-6000-System mit FP4-Gewichten auf TensorRT 10.14 über PCIe. Im Interactive-Szenario erreichte das H200-NVL-System 16.343,8 Token pro Sekunde, das 2,6-Fache des Ergebnisses 6.0-0004 vom Server eines anderen Herstellers, bei etwa 28 Token pro Sekunde für den Median-Stream gegenüber 27: nach unserer Rechnung etwa zweieinhalbmal so viele gleichzeitig laufende Anfragen innerhalb derselben Grenzen. Unser Vergleich mit der H200 NVL erklärt, warum.
Tests Dritter: ein Nutzer, ein Server, ein Fine-Tuning
| WER, WANN | HARDWARE, SOFTWARE | MODELL | ERGEBNIS |
|---|---|---|---|
| StorageReview, Oktober 2025 | 1 × Workstation, LM Studio, eine Anfrage | gpt-oss-120b | 163,15 Tok/s, erstes Token 0,193 s |
| StorageReview, Oktober 2025 | 1 × Workstation, LM Studio, eine Anfrage | Llama 3.1 70B Instruct | 31,84 Tok/s |
| StorageReview, November 2025 | 4 × Server Edition, vLLM, TP=4, Batch 1 | Llama 2 70B Chat | 32,89 Tok/s je Nutzer |
| StorageReview, November 2025 | 2 × Server Edition, vLLM, TP=2, Batch 1 | gpt-oss-120b, NVFP4 | 176,09 Tok/s je Nutzer |
| StorageReview, November 2025 | 4 × Server Edition, vLLM, TP=4, Batch 32 | gpt-oss-120b, NVFP4 | 3.956,44 Tok/s gesamt |
| Exxact, Juni 2026 | 1 × Server Edition, PyTorch, LoRA-Rang 16, BF16 | Llama 3.1 8B Instruct | 4.962 Tok/s bei 404,6 W im Mittel |
Die Tests von StorageReview zur RTX PRO 6000 Workstation (7. Oktober 2025) und zum HPE ProLiant DL380a Gen12 (6. November 2025); der Benchmark von Exxact zum LoRA-Fine-Tuning (4. Juni 2026). StorageReview nennt weder die Quantisierung seiner Modelle in LM Studio noch die Präzision seines Laufs mit Llama 2 70B Chat noch seine vLLM-Version; Exxact nennt seine Softwareversionen nicht.
Die Einzelkartenwerte von StorageReview stammen aus einem einzigen Prompt, der einen Aufsatz mit 500 Wörtern verlangt, auf einer Threadripper-Workstation unter Windows; da das Dateiformat nicht angegeben ist, lassen sie sich den Obergrenzen oben nicht gegenüberstellen. GamersNexus, das seine LLM-Diagramme als experimentell kennzeichnet, hat die Workstation Edition mit Llama 3.3 70B in einer 4-Bit-Quantisierung (Q4_K_S) 928 Prozent vor einer RTX 5090 gemessen, die Folge eines Modells, das in 96 GB passt und nicht in 32, wie unser Vergleich mit der RTX 5090 erklärt. Exxact, ein Systemintegrator, ließ sein LoRA-Fine-Tuning mit Rang 16 auf den Query- und Value-Projektionen laufen, mit Batch 2 je GPU und Sequenzen von 512 Token; zwei Karten mit verteiltem Datenparallelismus erreichten 9.541 Token pro Sekunde, was Exxact mit einer Skalierung von 96,1 Prozent beziffert.
Rendering, Bild und Video
Puget Systems hat die Workstation Edition im Juni 2025, aktualisiert im Juli, mit der RTX 6000 Ada verglichen, auf einem Ryzen 9 9950X mit Treiber 576.52: 50 Prozent schneller in Blender, mit nahezu gleichem Zuwachs im RTX-Modus von V-Ray, 55 Prozent in dessen CUDA-Modus, 34 Prozent in Unreal Engine und in DaVinci Resolve 43 Prozent in den LongGOP-Tests und 78 Prozent bei den GPU-Effekten. StorageReview hat die Workstation Edition in der Monster-Szene von Blender 4.4 mit 7.870 Samples pro Minute gemessen, vor den 7.421,5 der RTX 5090, und in V-Ray mit 12.128 vpaths, wo die 5090 mit 14.764 vorn lag; der Stable-Diffusion-XL-Test von UL Procyon in FP16 brauchte 5,364 Sekunden pro Bild.
Für die Server Edition führt NVIDIAs Seite zur Inferenzleistung, Stand September 2026, nur Vision-Modelle sowie Modelle zur Bild- und Videogenerierung, darunter Flux mit 0,20 Bildern pro Sekunde in FP4 bei Batch 1, Stable Diffusion XL mit 0,72 bei Batch 4 und Stable Video Diffusion mit 2,82 Videos pro Minute, mit TensorRT und ohne Angabe von Auflösung oder Schrittzahl. Phoronix zeigt in seinem Linux-Test der Familie (21. Mai 2026, Treiber 595.58.03) die Ergebnisse nur als Diagramme und stellt fest, dass die Blackwell-Karten „NVIDIAs Vorsprung bei der Leistung pro Watt gegenüber der Ada-Generation ausbauen“.
Max-Q, Leistungsaufnahme, Wärme und Lautstärke
Pugets Test vom Juli 2025 auf einem Threadripper PRO 7965WX sah die Max-Q mit 300 W in Blender, Octane, Redshift und V-Ray um 5 bis 13 Prozent hinter der Workstation Edition und bei den GPU-Effekten von DaVinci Resolve sowie in Unreal Engine um 14 Prozent dahinter; wir haben keinen veröffentlichten LLM-Test beider Editionen auf demselben Prüfstand gefunden. Unser Leitfaden zur Workstation mit vier Karten behandelt Tower mit vier Max-Q.
GamersNexus hat die Workstation Edition im September 2025 mit 82 °C am GPU-Kern und 88 °C am Speicher gemessen, per Software ausgelesen, bei einer Lüfterdrehzahl von 1.700 U/min und etwa 32,5 dBA. Die gesamte Workstation von StorageReview mit der Karte zog während Stable Diffusion XL im Mittel 918,5 W und in der Spitze 1.036,3 W, im Leerlauf 152,3 W. Die Server Edition hat keinen eigenen Lüfter und wird von den Lüftern des Servers gekühlt: NVIDIAs Product Brief nennt einen über einen Luftkanal geführten Mindestluftstrom durch den Kühlkörper von 43 CFM bei 25 °C Einlasstemperatur bis 125 CFM bei 45 °C, als Referenz für die Qualifizierung.
Grenzen, die das Datenblatt nicht ausdrücklich nennt
Kein NVLink. NVIDIAs Product Brief für die Server Edition führt NVLink als nicht unterstützt, und keine Edition hat es: Zwei Karten sind zwei GPUs mit 96 GB an PCIe 5.0 x16, kein einzelner Pool mit 192 GB. Tensor-Parallelismus funktioniert, wie die Läufe von StorageReview mit vier Karten zeigen, aber jeder Austausch läuft über PCIe, und ein Hinweis in der Dokumentation von vLLM schlägt auf Knoten ohne NVLink stattdessen Pipeline-Parallelismus vor, für höheren Durchsatz.
MIG braucht auf den Workstation-Editionen Vorbereitung. Alle drei lassen sich in bis zu vier Instanzen zu 24 GB, zwei zu 48 GB oder eine zu 96 GB aufteilen und brauchen auf Bare Metal oder im Passthrough Linux und Treiber 575.51.03 oder neuer; die Workstation Edition und die Max-Q brauchen außerdem ein Mindest-vBIOS und den auf Compute umgestellten Anzeigemodus, was die Displayausgänge abschaltet, während die Server Edition im Modus mit abgeschalteter Anzeige ausgeliefert wird. Unsere MIG-Anleitung enthält die Schritte.
vGPU nur auf der Server Edition, ab vGPU 19.0, in dem Modus mit abgeschalteter Anzeige, den vGPU laut NVIDIAs Product Brief voraussetzt.
Stromversorgung und Software. Die 600 W der Server Edition hängen vom Kabel ab: NVIDIAs Product Brief definiert einen 450-W-Modus für ein dafür beschaltetes 16-poliges Kabel und verlangt einen R575-Treiber und CUDA 12.9 oder neuer.
Wo sie die falsche Karte ist. Interaktives Serving von Modellen der 70B-Klasse für viele Nutzer gleichzeitig, wo die H200 NVL mit 4.800 GB/s HBM3e gegenüber 1.597 GB/s GDDR7 das 2,6-Fache des Interactive-Durchsatzes aus MLPerf Inference v6.0 weiter oben lieferte (Einträge 6.0-0021 und 6.0-0004, FP8- gegenüber FP4-Gewichten); Modelle, die mehr als 96 GB und schnellen Tensor-Parallelismus brauchen; Arbeit mit doppelter Genauigkeit, da FP64 laut NVIDIAs Whitepaper mit 1/64 der FP32-Rate läuft; virtuelle Desktops auf den Workstation-Editionen; und Server, die nur für Karten mit 350 W qualifiziert sind, wo die L40S weiterhin besser passen kann.
Was wir liefern
Eurokommerz liefert die RTX PRO 6000 Blackwell in allen drei Editionen, mit Herstellergarantie, unter einem EU-Vertrag und auf einer Rechnung. Unsere KI-Server werden auf Bestellung gebaut und von Ingenieuren für die Arbeitslast ausgelegt; zwei der drei Referenzkonfigurationen haben zwei beziehungsweise vier Karten der Server Edition, und jeder Build wird vor der Lieferung montiert und im Burn-in getestet. Unter demselben Vertrag baut unser Engineering-Partner Vixen.UNO die Plattform darauf auf: private LLMs auf vLLM, Ollama oder NVIDIA AI Enterprise und RAG unter Beachtung der Zugriffsrechte jedes Nutzers, beginnend mit einem Pilotprojekt auf einem Prozess mit klaren Metriken (KI/ML-Integration).
FAQ
Wie viele Token pro Sekunde erzeugt eine RTX PRO 6000 Blackwell?
Gibt es MLPerf-Ergebnisse für die RTX PRO 6000?
Wie viel langsamer ist die RTX PRO 6000 Max-Q als die Workstation Edition?
Unterstützt die RTX PRO 6000 NVLink?
Wie viel Leistung nimmt die RTX PRO 6000 in der Praxis auf?
Wie viel von den 96 GB kann Software nutzen?
Schicken Sie uns das Modell, die Präzision, die Kontextlänge und die Zahl gleichzeitiger Nutzer, und sagen Sie uns, ob die Karten in eine Workstation oder in ein Rack kommen. Wir nennen Ihnen die Edition, die Kartenzahl, die sich mit den veröffentlichten Zahlen belegen lässt, und eine erste Konfiguration. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages