NVIDIA RTX PRO 5000 Blackwell, 48 GB und 72 GB: echte Benchmarks und Grenzen
- Die RTX PRO 5000 nutzt den Chip GB202 der RTX PRO 6000 und hat 14.080 CUDA-Kerne, 1.344 GB/s und 300 W; ihre Versionen mit 48 GB und 72 GB unterscheiden sich in Speicher, Größe der MIG-Instanzen und vGPU-Unterstützung
- Im Dezember 2025 hat Puget Systems sie in Blender 50 Prozent vor der RTX 5000 Ada gemessen, in V-Ray GPU 35 Prozent und in Octane 58 Prozent, und im August 2026 lag sie in Topaz Video 19 Prozent hinter der RTX PRO 6000 Workstation Edition
- Laut Puget lagen die Versionen mit 48 GB und 72 GB im August 2026 in Topaz Video 1.6.1 innerhalb seiner Messtoleranz und im September 2026 in Starlight Mini weniger als 1 Prozent auseinander
- Veröffentlichte Werte zu Sprachmodellen sind dünn gesät: Phoronix und Puget geben ihre Token-Raten nur in Diagrammen an, der Text von NVIDIAs Beitrag zur 72-GB-Karte nennt keine Vergleichskarte, kein Modell und keine Präzision, und in den Ergebnissen, die wir lesen konnten, haben wir keinen Eintrag in MLPerf® Inference gefunden
- Nach unserer Rechnung begrenzen 1.344 GB/s einen einzelnen Stream von Llama 3.3 70B in NVFP4 ohne spekulatives Dekodieren auf etwa 33 Token pro Sekunde, drei Viertel der Obergrenze der Workstation-Karten der RTX PRO 6000 mit 1.792 GB/s
Wo die Karte steht
Die RTX PRO 5000 Blackwell basiert auf einem beschnittenen GB202, dem Chip der RTX PRO 6000, mit 14.080 CUDA-Kernen gegenüber den 24.064 der 6000. NVIDIA hat sie im März 2025 angekündigt; eine Version mit 72 GB erschien im Oktober 2025 auf NVIDIAs Website und wurde im Dezember 2025 allgemein verfügbar. In NVIDIAs Datenblatt sind alle Leistungsdaten der beiden Versionen gleich; sie unterscheiden sich in Speicher, Größe der MIG-Instanzen und vGPU-Unterstützung.
| SPEZIFIKATION | RTX PRO 4500 | RTX PRO 5000 | RTX PRO 6000 MAX-Q | RTX PRO 6000, 600 W |
|---|---|---|---|---|
| CUDA-Kerne | 10.496 | 14.080 | 24.064 | 24.064 |
| Speicher | 32 GB GDDR7 | 48 oder 72 GB GDDR7 | 96 GB GDDR7 | 96 GB GDDR7 |
| Bandbreite | 896 GB/s | 1.344 GB/s | 1.792 GB/s | 1.792 GB/s |
| AI TOPS (FP4, mit Sparsity) | 1.617 | 2.064 | 3.511 | 4.000 |
| Leistung | 200 W | 300 W | 300 W | 600 W |
| MIG | 2 × 16 GB, unbestätigt | 2 × 24 GB oder 2 × 36 GB | bis zu 4 × 24 GB | bis zu 4 × 24 GB |
| vGPU | nein | nur 72 GB, Red Hat KVM 9.6 | nein | nein |
NVIDIA-Datenblätter und Produktseiten (2025 bis 2026), MIG-Leitfaden vom 11. September 2026, vGPU-Support-Matrix vom 22. September 2026. Die Busbreite der RTX PRO 5000 beträgt 384 Bit in NVIDIAs Datenblatt vom Oktober 2025 und 512 Bit in der Ausgabe vom Juni 2026; NVIDIAs Blogbeitrag vom Dezember 2025 zur 72-GB-Karte nennt 2.142 TOPS. Der MIG-Leitfaden führt eine RTX PRO 4500, ohne ihre Edition zu nennen; das Datenblatt der Workstation-Karte erwähnt MIG nicht. Die Spalten zur 4500 und zur 6000 mit 600 W zeigen die Workstation-Karten; die Server Editions unterstützen vGPU, die 4500 (800 GB/s) ab vGPU 20.0 und die 6000 (1.597 GB/s) ab 19.0.
Gegenüber der RTX PRO 6000 mit 600 W hat die 5000 drei Viertel der Bandbreite und etwa die Hälfte der Tensor-Spitzenleistung; gegenüber der RTX PRO 4500 das 1,5-Fache der Bandbreite. Die Bandbreite bestimmt das Tempo der Textgenerierung; Rendering und das Lesen des Prompts hängen vor allem von der Rechenleistung ab. Unser Familienvergleich und der Artikel zur RTX PRO 4500 behandeln die Nachbarmodelle.
Was gemessen wurde, und von wem
Die Liste unabhängiger Messungen ist kurz. Puget Systems hat die 48-GB-Karte in seinen Vergleichstests zu Content Creation und zu Engineering vom 18. Dezember 2025 getestet und beide Speichergrößen in zwei Tests mit Topaz Video im August und September 2026. Phoronix hat die 48-GB-Karte in seinen Linux-Test vom 21. Mai 2026 aufgenommen (Ubuntu 26.04 LTS, NVIDIA-Treiber 595.58.03) und veröffentlicht seine Ergebnisse als Diagramme. Wir haben keinen Test der Desktop-Karte von StorageReview, ServeTheHome oder Level1Techs gefunden.
Zwei Stolperfallen. Auch NVIDIAs Laptop-Reihe hat eine RTX PRO 5000 Blackwell, mit 10.496 CUDA-Kernen, 24 GB und 896 GB/s bei 95 bis 175 W; die Tests von StorageReview zur RTX PRO 5000 betreffen solche Laptops und sagen nichts über die Desktop-Karte aus. Und mehrere Websites veröffentlichen für die Desktop-Karte Tabellen mit Token pro Sekunde, in denen die Engine-Version, die Zahl gleichzeitiger Anfragen oder das Testsystem fehlen. Wir lassen sie außen vor: Sie sind nicht fair vergleichbar.
Rendering, Video und CAD: Pugets Zahlen
Pugets Tests vom Dezember 2025 liefen auf einem Ryzen 9 9950X3D unter Windows 11 mit NVIDIA-Treiber 573.92, seine Topaz-Tests von 2026 auf einem Threadripper PRO 9965WX mit Treiber 596.72.
| PUGET-TEST | ERGEBNIS DER 5000 | VERGLICHEN MIT |
|---|---|---|
| Blender | 50 % schneller | RTX 5000 Ada |
| V-Ray GPU | 35 % schneller; 11 % vor der RTX 6000 Ada | RTX 5000 Ada |
| Octane | 58 % schneller | RTX 5000 Ada |
| Topaz Video AI | 25 % schneller; 8 % vor der RTX 6000 Ada | RTX 5000 Ada |
| Unreal Engine | 18 % schneller | RTX 5000 Ada |
| Topaz Video 1.6.1 | 48-GB-Karte 19 % langsamer | RTX PRO 6000 Workstation Edition |
| Topaz Video 1.6.1 | 72-GB-Karte 7 % langsamer | RTX PRO 6000 Max-Q |
| Starlight Mini | unter 11 s pro Frame, beide Versionen | unter 8 s auf der RTX PRO 6000 Workstation Edition |
| Starlight Precise 2.5 | knapp über 6 s pro Frame | unter 5 s auf der RTX PRO 6000 Workstation Edition |
Puget Systems: „2025 Professional GPU Content Creation Roundup“, 18. Dezember 2025 (erste fünf Zeilen, 48-GB-Karte); Analyse zu Topaz Video 1.6.1, 24. August 2026 (Gesamtwertung); Starlight-Test, 17. September 2026.
Für Käufer ändert die Speichergröße nichts am Tempo, wenn die Arbeit hineinpasst: Puget fand in Topaz Video 1.6.1 einen „vernachlässigbaren Leistungsunterschied zwischen den beiden Varianten, klein genug, um innerhalb unserer Messtoleranz zu liegen“, und in Starlight Mini weniger als 1 Prozent. Die Karte kommt der RTX PRO 6000 Workstation Edition auch näher, als ihre Kernzahl vermuten lässt: In Topaz Video liegt sie 19 Prozent zurück, mit 59 Prozent der Kerne und der halben Leistungsaufnahme.
CAD profitiert am wenigsten. Pugets Engineering-Vergleichstest stellte fest, dass „selbst die Grafiktests in Inventor relativ unempfindlich gegenüber GPUs sind, sobald eine gewisse Schwelle erreicht ist“, dass Revit „in erster Linie CPU-abhängig ist“ und dass jede dort getestete AMD-Karte die schnellste NVIDIA-Karte im Zeichnungstest von SOLIDWORKS um mindestens 18 Prozent schlug.
Sprachmodelle: Die veröffentlichte Datenlage ist dünn
Phoronix hat llama.cpp auf seinen RTX-PRO-Karten laufen lassen, darunter die 5000 mit 48 GB, und dabei die Generierung von 128 Token sowie die Prompt-Verarbeitung von 512 und 2.048 Token gemessen. Die Modelle waren Q8_0-Dateien von Llama-3.1-Tulu-3-8B, Mistral-7B-Instruct-v0.3, DeepSeek-R1-Distill-Llama-8B und gpt-oss-20b auf dem GPU- und dem Vulkan-Backend von llama.cpp, dazu GLM-4.7-Flash in IQ4_XS auf dem GPU-Backend und granite-3.0-3b-a800m-instruct in Q8_0 auf Vulkan. Die Werte stehen in Diagrammbildern, die Zahl gleichzeitiger Anfragen ist nicht angegeben, und der Text sagt nur, dass die Karte „das Flaggschiff der Vorgängergeneration, die RTX 6000 Ada Generation, hinter sich ließ“. In den eigenen Läufen von Puget Systems mit MLPerf® Client v1.0 standen die 6000-Karten der Blackwell-Generation und die 5000 an der Spitze des Diagramms zur Zeit bis zum ersten Token, wo sie „die 6000 Ada nur knapp schlugen“, und die Token-Rate der Blackwell-Karten lag im Schnitt 50 Prozent über der von Ada, die RTX PRO 2000 ausgenommen; der Text nennt weder das Modell noch den Ausführungspfad, und diese Ergebnisse sind nicht verifiziert, nicht von der MLCommons Association geprüft.
Result not verified by MLCommons Association. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information.
Die MLPerf-Client-Seite von MLCommons enthält keine Ergebnistabellen, und in den Ergebnissen von MLPerf Inference, die wir lesen konnten, haben wir kein System mit der Karte gefunden. NVIDIAs Blogbeitrag zur 72-GB-Karte verspricht die doppelte Leistung bei der Textgenerierung und die 3,5-fache bei der Bildgenerierung gegenüber „NVIDIA-Hardware der Vorgängergeneration“ in „branchenüblichen Benchmarks für generative KI“; der Text des Beitrags nennt keine Vergleichskarte, kein Modell und keine Präzision. NVIDIAs Performance-Übersicht zu TensorRT-LLM vom 21. September 2026 behandelt die RTX PRO 6000 Server Edition, nicht die 5000. Wir haben für diese Karte also keinen Wert in Token pro Sekunde gefunden, der die Engine und ihre Version, die Präzision, die Zahl gleichzeitiger Anfragen und das Testsystem zusammen nennt. Was bleibt, sind die Obergrenze weiter unten und ein Lasttest mit Ihrem eigenen Modell; das technische Assessment der KI/ML-Integration unseres Engineering-Partners Vixen.UNO umfasst die Modell- und GPU-Auswahl und einen Pilotplan mit Metriken.
Was 1.344 GB/s erlauben
Um für einen Nutzer ein Token zu generieren, wird jedes aktive Gewicht einmal gelesen; einfaches Dekodieren eines einzelnen Streams kann daher die Bandbreite geteilt durch die pro Token gelesenen Byte nicht übertreffen. Diese Grenze ist eine Obergrenze, keine Prognose: Reale Engines bleiben darunter, und der KV-Cache fügt mit wachsendem Kontext Lesezugriffe hinzu. Spekulatives Dekodieren, bei dem ein Lesedurchgang der Gewichte mehrere vorab entworfene Token prüft, ist die Ausnahme, die sie überschreiten kann.
| MODELL UND FORMAT | GEWICHTE | GELESEN PRO TOKEN | GRENZE, EIN STREAM | PASST IN |
|---|---|---|---|---|
| gpt-oss-20b, MXFP4 | 12,8 GiB | etwa 3,7 GB | etwa 360 Tok/s | 48 und 72 GB |
| Qwen3-32B, NVFP4 | 19,3 GiB | etwa 19,1 GB | etwa 70 Tok/s | 48 und 72 GB |
| Llama 3.3 70B, NVFP4 | 40 GiB | 40,6 GB | etwa 33 Tok/s | 72 GB; 48 GB mit kurzem Kontext |
| gpt-oss-120b, MXFP4 | 60,8 GiB | etwa 5,0 GB | etwa 270 Tok/s | nur 72 GB |
Unsere Rechnung: 1.344 GB/s geteilt durch die pro Token gelesenen Byte (lineare Schichten und Ausgabeschicht; in der Embedding-Tabelle wird nur nachgeschlagen). Gewichte in GiB, aus den Checkpoints von OpenAI und NVIDIA; Byte pro Token in GB, da die Bandbreite in GB/s angegeben wird. Passt in: 90 Prozent der Karte für Gewichte und Cache. Die 1.792 GB/s der Workstation-Karten der RTX PRO 6000 heben jede Obergrenze um ein Drittel.
Die Mixture-of-Experts-Modelle lesen nur die Experten, die das jeweilige Token nutzt, bei gpt-oss-120b insgesamt etwa 5 GB pro Token; doch je weniger Byte ein Token liest, desto stärker fallen die festen Kosten jedes Schritts ins Gewicht und desto weiter bleiben reale Engines unter der Linie.
Bei mehreren Nutzern werden die Gewichte eines dichten Modells einmal pro Schritt für den ganzen Batch gelesen; der aggregierte Durchsatz wächst also mit der Zahl gleichzeitiger Anfragen, bis Rechenleistung oder Platz für den Cache ausgeht. Beim Cache zieht die 72-GB-Karte davon: Neben einem 70B-Modell in 4 Bit lässt sie nach 10 Prozent Reserve etwa 25 GiB frei, die 48-GB-Karte etwa 3 GiB; unser Vergleich 48 GB oder 72 GB enthält die vollständige Tabelle. Das Lesen des Prompts ist rechenlimitiert, und dort wächst der Abstand zur RTX PRO 6000 mit 600 W von einem Viertel auf etwa die Hälfte: 2.064 AI TOPS gegenüber 4.000, oder nach unserer Rechnung etwa 516 TFLOPS in FP8 ohne Sparsity gegenüber 1.000. Am stärksten macht sich das bei langen Prompts für RAG und Coding-Agenten bemerkbar.
Stromversorgung, Kühlung und mehrere Karten
Die Karte hat eine Leistungsaufnahme (Total Board Power) von 300 W und einen 16-poligen PCIe-CEM5-Stromanschluss; NVIDIAs Schnellstartanleitung führt einen Adapter für zwei 8-polige PCIe-Kabel im Lieferumfang auf. Sie ist eine Dual-Slot-Karte in voller Bauhöhe mit 4,4 × 10,5 Zoll; NVIDIA bezeichnet den Kühler als aktiv, und NVIDIAs Boardpartner Leadtek nennt ein Radialgebläse, das die Abluft durch die Slotblende ausbläst. Wir haben für die Desktop-Karte keine im Text veröffentlichten Werte zu Leistungsaufnahme, Temperatur oder Lautstärke gefunden; Phoronix hat die Leistungsaufnahme der GPU protokolliert, zeigt sie aber nur in Diagrammen.
Vier Karten ziehen bis zu 1,2 kW, den Prozessor noch nicht mitgerechnet. Ohne NVLink kommunizieren sie über PCIe 5.0 x16; das eignet sich besser für ein Modell oder ein Team pro Karte als für ein über mehrere Karten verteiltes Modell, dessen All-Reduce-Operationen beim Tensor-Parallelismus dann über PCIe laufen. Die individuellen KI-Server, die wir auf Bestellung bauen, umfassen Workstations und Server mit kurzer Einbautiefe auf Threadripper-PRO- oder Xeon-W-Plattformen mit RTX-PRO-Blackwell-Workstation-Karten, mit Rack-, Strom- und Luftstromprüfung vor dem Angebot und Burn-in-Tests nach der Montage.
MIG, vGPU und Software
NVIDIAs MIG-Leitfaden vom 11. September 2026 führt die 48-GB-Karte mit zwei isolierten Instanzen 1g.24gb oder einer 2g.48gb, jeweils auch als +gfx-Variante für Grafik; die 72-GB-Karte steht noch nicht im Leitfaden, und ihr Datenblatt nennt zwei Instanzen zu 36 GB. Lesen Sie ihre Profilnamen daher nach dem Aktivieren des MIG-Modus mit nvidia-smi mig -lgip aus. MIG braucht Linux, Treiber 575.51.03 oder neuer, ein vBIOS 98.02.73.00.00 oder neuer auf der 48-GB-Karte und den mit DisplayModeSelector 1.72 oder neuer auf Compute umgestellten Anzeigemodus, bei der 72-GB-Karte laut NVIDIA-Mitarbeitern mit Version 1.76 oder neuer. Die Karte steuert dann kein Display mehr an, und laut NVIDIA muss das System für diesen Modus qualifiziert sein.
vGPU gibt es nur für die 72-GB-Karte, ab vGPU 20.2 vom August 2026, und Stand September 2026 führen NVIDIAs Support-Matrizen sie nur für Red Hat Enterprise Linux mit KVM 9.6; für VMware vSphere nennen sie von den RTX-PRO-Blackwell-Karten nur die Server Editions der RTX PRO 6000 und 4500. Die Karte hat die Compute Capability 12.0: NVIDIAs Datenblatt nennt CUDA 12.8, und PyTorch hat die Unterstützung für Blackwell in Release 2.7 mit Wheels für CUDA 12.8 eingeführt; prüfen Sie daher zuerst Container, die auf älteren CUDA-Versionen aufbauen.
Wo sie passt, und wo nicht
Die Messungen sprechen für die RTX PRO 5000 als Karte für Rendering und Video, deutlich vor der RTX 5000 Ada und in Topaz Video nicht mehr als 19 Prozent hinter der RTX PRO 6000 Workstation Edition, bei halber Leistungsaufnahme. Bei Sprachmodellen beruht das Argument für sie auf Speicher und Rechnung: 48 GB für Modelle bis 32B in FP8 oder ein 70B-Modell in 4 Bit für einen oder zwei Nutzer, 72 GB für gpt-oss-120b oder ein 70B-Modell in 4 Bit, das ein kleines Team bedient.
Für ein 70B-Modell in FP8 ist sie die falsche Karte: Neben seinen 68 GiB Gewichten lassen 72 GB zu wenig Platz für die Laufzeitumgebung und für den Cache, den eine sinnvolle Zahl gleichzeitiger Anfragen braucht. Die neue RTX PRO 5500 mit 84 GB fasst ein solches Modell mit wenig Cache, die RTX PRO 6000 mit 96 GB mit mehr. Die falsche Karte ist sie auch für vGPU außerhalb von Red Hat KVM 9.6, für einen reinen CAD-Arbeitsplatz und für ein Modell, das für eine Karte zu groß ist und ohne NVLink über PCIe aufgeteilt werden muss. Bei denselben 300 W bringt die RTX PRO 6000 Max-Q 96 GB, 1.792 GB/s und 3.511 AI TOPS mit, und die 72-GB-Karte lag in Pugets Topaz-Test 7 Prozent unter ihr; ob sich dieser Schritt lohnt, hängt vom Modell und vom Budget ab.
Was wir liefern
Eurokommerz liefert die RTX PRO 5000 Blackwell in beiden Speichergrößen EU-weit, mit Herstellergarantie sowie EU-Vertrag und EU-Rechnung, als einzelne Karte oder in einer konfigurierten Workstation; siehe den Katalogeintrag. Für die Plattform darüber liefert unser Engineering-Partner Vixen.UNO KI/ML-Integration: private LLMs bei Ihnen vor Ort mit vLLM, Ollama oder NVIDIA AI Enterprise, RAG-Assistenten, die die Zugriffsrechte jedes Nutzers beachten, und ein Pilotprojekt auf einem Prozess mit klaren Metriken, bei dem nur skaliert wird, was seinen Wert bewiesen hat. Der Vertrag bleibt bei Eurokommerz.
FAQ
Wie viele Token pro Sekunde generiert die RTX PRO 5000?
Ist die RTX PRO 5000 mit 72 GB schneller als die Version mit 48 GB?
Wie viel schneller ist die RTX PRO 5000 als die RTX 5000 Ada?
Wie schlägt sich die RTX PRO 5000 im Vergleich zur RTX PRO 6000?
Unterstützt die RTX PRO 5000 MIG und vGPU?
Gelten Tests der Laptop-Version der RTX PRO 5000 für die Desktop-Karte?
Nennen Sie uns die Modelle und die Präzision, die Sie einsetzen wollen, und wie viele Personen sie gleichzeitig nutzen werden, oder Ihren Renderer und Ihre größte Szene. Wir sagen Ihnen, ob die RTX PRO 5000 mit 48 GB oder die mit 72 GB passt oder eine andere Karte, und konfigurieren die Workstation um die Karte herum. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages