BLOG · HARDWARE-REVIEW ·

NVIDIA RTX PRO 5000 Blackwell, 48 GB und 72 GB: echte Benchmarks und Grenzen

IN KÜRZE
  • Die RTX PRO 5000 nutzt den Chip GB202 der RTX PRO 6000 und hat 14.080 CUDA-Kerne, 1.344 GB/s und 300 W; ihre Versionen mit 48 GB und 72 GB unterscheiden sich in Speicher, Größe der MIG-Instanzen und vGPU-Unterstützung
  • Im Dezember 2025 hat Puget Systems sie in Blender 50 Prozent vor der RTX 5000 Ada gemessen, in V-Ray GPU 35 Prozent und in Octane 58 Prozent, und im August 2026 lag sie in Topaz Video 19 Prozent hinter der RTX PRO 6000 Workstation Edition
  • Laut Puget lagen die Versionen mit 48 GB und 72 GB im August 2026 in Topaz Video 1.6.1 innerhalb seiner Messtoleranz und im September 2026 in Starlight Mini weniger als 1 Prozent auseinander
  • Veröffentlichte Werte zu Sprachmodellen sind dünn gesät: Phoronix und Puget geben ihre Token-Raten nur in Diagrammen an, der Text von NVIDIAs Beitrag zur 72-GB-Karte nennt keine Vergleichskarte, kein Modell und keine Präzision, und in den Ergebnissen, die wir lesen konnten, haben wir keinen Eintrag in MLPerf® Inference gefunden
  • Nach unserer Rechnung begrenzen 1.344 GB/s einen einzelnen Stream von Llama 3.3 70B in NVFP4 ohne spekulatives Dekodieren auf etwa 33 Token pro Sekunde, drei Viertel der Obergrenze der Workstation-Karten der RTX PRO 6000 mit 1.792 GB/s

Wo die Karte steht

Die RTX PRO 5000 Blackwell basiert auf einem beschnittenen GB202, dem Chip der RTX PRO 6000, mit 14.080 CUDA-Kernen gegenüber den 24.064 der 6000. NVIDIA hat sie im März 2025 angekündigt; eine Version mit 72 GB erschien im Oktober 2025 auf NVIDIAs Website und wurde im Dezember 2025 allgemein verfügbar. In NVIDIAs Datenblatt sind alle Leistungsdaten der beiden Versionen gleich; sie unterscheiden sich in Speicher, Größe der MIG-Instanzen und vGPU-Unterstützung.

SPEZIFIKATIONRTX PRO 4500RTX PRO 5000RTX PRO 6000 MAX-QRTX PRO 6000, 600 W
CUDA-Kerne10.49614.08024.06424.064
Speicher32 GB GDDR748 oder 72 GB GDDR796 GB GDDR796 GB GDDR7
Bandbreite896 GB/s1.344 GB/s1.792 GB/s1.792 GB/s
AI TOPS (FP4, mit Sparsity)1.6172.0643.5114.000
Leistung200 W300 W300 W600 W
MIG2 × 16 GB, unbestätigt2 × 24 GB oder 2 × 36 GBbis zu 4 × 24 GBbis zu 4 × 24 GB
vGPUneinnur 72 GB, Red Hat KVM 9.6neinnein

NVIDIA-Datenblätter und Produktseiten (2025 bis 2026), MIG-Leitfaden vom 11. September 2026, vGPU-Support-Matrix vom 22. September 2026. Die Busbreite der RTX PRO 5000 beträgt 384 Bit in NVIDIAs Datenblatt vom Oktober 2025 und 512 Bit in der Ausgabe vom Juni 2026; NVIDIAs Blogbeitrag vom Dezember 2025 zur 72-GB-Karte nennt 2.142 TOPS. Der MIG-Leitfaden führt eine RTX PRO 4500, ohne ihre Edition zu nennen; das Datenblatt der Workstation-Karte erwähnt MIG nicht. Die Spalten zur 4500 und zur 6000 mit 600 W zeigen die Workstation-Karten; die Server Editions unterstützen vGPU, die 4500 (800 GB/s) ab vGPU 20.0 und die 6000 (1.597 GB/s) ab 19.0.

Gegenüber der RTX PRO 6000 mit 600 W hat die 5000 drei Viertel der Bandbreite und etwa die Hälfte der Tensor-Spitzenleistung; gegenüber der RTX PRO 4500 das 1,5-Fache der Bandbreite. Die Bandbreite bestimmt das Tempo der Textgenerierung; Rendering und das Lesen des Prompts hängen vor allem von der Rechenleistung ab. Unser Familienvergleich und der Artikel zur RTX PRO 4500 behandeln die Nachbarmodelle.

Was gemessen wurde, und von wem

Die Liste unabhängiger Messungen ist kurz. Puget Systems hat die 48-GB-Karte in seinen Vergleichstests zu Content Creation und zu Engineering vom 18. Dezember 2025 getestet und beide Speichergrößen in zwei Tests mit Topaz Video im August und September 2026. Phoronix hat die 48-GB-Karte in seinen Linux-Test vom 21. Mai 2026 aufgenommen (Ubuntu 26.04 LTS, NVIDIA-Treiber 595.58.03) und veröffentlicht seine Ergebnisse als Diagramme. Wir haben keinen Test der Desktop-Karte von StorageReview, ServeTheHome oder Level1Techs gefunden.

Zwei Stolperfallen. Auch NVIDIAs Laptop-Reihe hat eine RTX PRO 5000 Blackwell, mit 10.496 CUDA-Kernen, 24 GB und 896 GB/s bei 95 bis 175 W; die Tests von StorageReview zur RTX PRO 5000 betreffen solche Laptops und sagen nichts über die Desktop-Karte aus. Und mehrere Websites veröffentlichen für die Desktop-Karte Tabellen mit Token pro Sekunde, in denen die Engine-Version, die Zahl gleichzeitiger Anfragen oder das Testsystem fehlen. Wir lassen sie außen vor: Sie sind nicht fair vergleichbar.

Rendering, Video und CAD: Pugets Zahlen

Pugets Tests vom Dezember 2025 liefen auf einem Ryzen 9 9950X3D unter Windows 11 mit NVIDIA-Treiber 573.92, seine Topaz-Tests von 2026 auf einem Threadripper PRO 9965WX mit Treiber 596.72.

PUGET-TESTERGEBNIS DER 5000VERGLICHEN MIT
Blender50 % schnellerRTX 5000 Ada
V-Ray GPU35 % schneller; 11 % vor der RTX 6000 AdaRTX 5000 Ada
Octane58 % schnellerRTX 5000 Ada
Topaz Video AI25 % schneller; 8 % vor der RTX 6000 AdaRTX 5000 Ada
Unreal Engine18 % schnellerRTX 5000 Ada
Topaz Video 1.6.148-GB-Karte 19 % langsamerRTX PRO 6000 Workstation Edition
Topaz Video 1.6.172-GB-Karte 7 % langsamerRTX PRO 6000 Max-Q
Starlight Miniunter 11 s pro Frame, beide Versionenunter 8 s auf der RTX PRO 6000 Workstation Edition
Starlight Precise 2.5knapp über 6 s pro Frameunter 5 s auf der RTX PRO 6000 Workstation Edition

Puget Systems: „2025 Professional GPU Content Creation Roundup“, 18. Dezember 2025 (erste fünf Zeilen, 48-GB-Karte); Analyse zu Topaz Video 1.6.1, 24. August 2026 (Gesamtwertung); Starlight-Test, 17. September 2026.

Für Käufer ändert die Speichergröße nichts am Tempo, wenn die Arbeit hineinpasst: Puget fand in Topaz Video 1.6.1 einen „vernachlässigbaren Leistungsunterschied zwischen den beiden Varianten, klein genug, um innerhalb unserer Messtoleranz zu liegen“, und in Starlight Mini weniger als 1 Prozent. Die Karte kommt der RTX PRO 6000 Workstation Edition auch näher, als ihre Kernzahl vermuten lässt: In Topaz Video liegt sie 19 Prozent zurück, mit 59 Prozent der Kerne und der halben Leistungsaufnahme.

CAD profitiert am wenigsten. Pugets Engineering-Vergleichstest stellte fest, dass „selbst die Grafiktests in Inventor relativ unempfindlich gegenüber GPUs sind, sobald eine gewisse Schwelle erreicht ist“, dass Revit „in erster Linie CPU-abhängig ist“ und dass jede dort getestete AMD-Karte die schnellste NVIDIA-Karte im Zeichnungstest von SOLIDWORKS um mindestens 18 Prozent schlug.

Sprachmodelle: Die veröffentlichte Datenlage ist dünn

Phoronix hat llama.cpp auf seinen RTX-PRO-Karten laufen lassen, darunter die 5000 mit 48 GB, und dabei die Generierung von 128 Token sowie die Prompt-Verarbeitung von 512 und 2.048 Token gemessen. Die Modelle waren Q8_0-Dateien von Llama-3.1-Tulu-3-8B, Mistral-7B-Instruct-v0.3, DeepSeek-R1-Distill-Llama-8B und gpt-oss-20b auf dem GPU- und dem Vulkan-Backend von llama.cpp, dazu GLM-4.7-Flash in IQ4_XS auf dem GPU-Backend und granite-3.0-3b-a800m-instruct in Q8_0 auf Vulkan. Die Werte stehen in Diagrammbildern, die Zahl gleichzeitiger Anfragen ist nicht angegeben, und der Text sagt nur, dass die Karte „das Flaggschiff der Vorgängergeneration, die RTX 6000 Ada Generation, hinter sich ließ“. In den eigenen Läufen von Puget Systems mit MLPerf® Client v1.0 standen die 6000-Karten der Blackwell-Generation und die 5000 an der Spitze des Diagramms zur Zeit bis zum ersten Token, wo sie „die 6000 Ada nur knapp schlugen“, und die Token-Rate der Blackwell-Karten lag im Schnitt 50 Prozent über der von Ada, die RTX PRO 2000 ausgenommen; der Text nennt weder das Modell noch den Ausführungspfad, und diese Ergebnisse sind nicht verifiziert, nicht von der MLCommons Association geprüft.

Result not verified by MLCommons Association. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information.

Die MLPerf-Client-Seite von MLCommons enthält keine Ergebnistabellen, und in den Ergebnissen von MLPerf Inference, die wir lesen konnten, haben wir kein System mit der Karte gefunden. NVIDIAs Blogbeitrag zur 72-GB-Karte verspricht die doppelte Leistung bei der Textgenerierung und die 3,5-fache bei der Bildgenerierung gegenüber „NVIDIA-Hardware der Vorgängergeneration“ in „branchenüblichen Benchmarks für generative KI“; der Text des Beitrags nennt keine Vergleichskarte, kein Modell und keine Präzision. NVIDIAs Performance-Übersicht zu TensorRT-LLM vom 21. September 2026 behandelt die RTX PRO 6000 Server Edition, nicht die 5000. Wir haben für diese Karte also keinen Wert in Token pro Sekunde gefunden, der die Engine und ihre Version, die Präzision, die Zahl gleichzeitiger Anfragen und das Testsystem zusammen nennt. Was bleibt, sind die Obergrenze weiter unten und ein Lasttest mit Ihrem eigenen Modell; das technische Assessment der KI/ML-Integration unseres Engineering-Partners Vixen.UNO umfasst die Modell- und GPU-Auswahl und einen Pilotplan mit Metriken.

Was 1.344 GB/s erlauben

Um für einen Nutzer ein Token zu generieren, wird jedes aktive Gewicht einmal gelesen; einfaches Dekodieren eines einzelnen Streams kann daher die Bandbreite geteilt durch die pro Token gelesenen Byte nicht übertreffen. Diese Grenze ist eine Obergrenze, keine Prognose: Reale Engines bleiben darunter, und der KV-Cache fügt mit wachsendem Kontext Lesezugriffe hinzu. Spekulatives Dekodieren, bei dem ein Lesedurchgang der Gewichte mehrere vorab entworfene Token prüft, ist die Ausnahme, die sie überschreiten kann.

MODELL UND FORMATGEWICHTEGELESEN PRO TOKENGRENZE, EIN STREAMPASST IN
gpt-oss-20b, MXFP412,8 GiBetwa 3,7 GBetwa 360 Tok/s48 und 72 GB
Qwen3-32B, NVFP419,3 GiBetwa 19,1 GBetwa 70 Tok/s48 und 72 GB
Llama 3.3 70B, NVFP440 GiB40,6 GBetwa 33 Tok/s72 GB; 48 GB mit kurzem Kontext
gpt-oss-120b, MXFP460,8 GiBetwa 5,0 GBetwa 270 Tok/snur 72 GB

Unsere Rechnung: 1.344 GB/s geteilt durch die pro Token gelesenen Byte (lineare Schichten und Ausgabeschicht; in der Embedding-Tabelle wird nur nachgeschlagen). Gewichte in GiB, aus den Checkpoints von OpenAI und NVIDIA; Byte pro Token in GB, da die Bandbreite in GB/s angegeben wird. Passt in: 90 Prozent der Karte für Gewichte und Cache. Die 1.792 GB/s der Workstation-Karten der RTX PRO 6000 heben jede Obergrenze um ein Drittel.

Die Mixture-of-Experts-Modelle lesen nur die Experten, die das jeweilige Token nutzt, bei gpt-oss-120b insgesamt etwa 5 GB pro Token; doch je weniger Byte ein Token liest, desto stärker fallen die festen Kosten jedes Schritts ins Gewicht und desto weiter bleiben reale Engines unter der Linie.

Bei mehreren Nutzern werden die Gewichte eines dichten Modells einmal pro Schritt für den ganzen Batch gelesen; der aggregierte Durchsatz wächst also mit der Zahl gleichzeitiger Anfragen, bis Rechenleistung oder Platz für den Cache ausgeht. Beim Cache zieht die 72-GB-Karte davon: Neben einem 70B-Modell in 4 Bit lässt sie nach 10 Prozent Reserve etwa 25 GiB frei, die 48-GB-Karte etwa 3 GiB; unser Vergleich 48 GB oder 72 GB enthält die vollständige Tabelle. Das Lesen des Prompts ist rechenlimitiert, und dort wächst der Abstand zur RTX PRO 6000 mit 600 W von einem Viertel auf etwa die Hälfte: 2.064 AI TOPS gegenüber 4.000, oder nach unserer Rechnung etwa 516 TFLOPS in FP8 ohne Sparsity gegenüber 1.000. Am stärksten macht sich das bei langen Prompts für RAG und Coding-Agenten bemerkbar.

Stromversorgung, Kühlung und mehrere Karten

Die Karte hat eine Leistungsaufnahme (Total Board Power) von 300 W und einen 16-poligen PCIe-CEM5-Stromanschluss; NVIDIAs Schnellstartanleitung führt einen Adapter für zwei 8-polige PCIe-Kabel im Lieferumfang auf. Sie ist eine Dual-Slot-Karte in voller Bauhöhe mit 4,4 × 10,5 Zoll; NVIDIA bezeichnet den Kühler als aktiv, und NVIDIAs Boardpartner Leadtek nennt ein Radialgebläse, das die Abluft durch die Slotblende ausbläst. Wir haben für die Desktop-Karte keine im Text veröffentlichten Werte zu Leistungsaufnahme, Temperatur oder Lautstärke gefunden; Phoronix hat die Leistungsaufnahme der GPU protokolliert, zeigt sie aber nur in Diagrammen.

Vier Karten ziehen bis zu 1,2 kW, den Prozessor noch nicht mitgerechnet. Ohne NVLink kommunizieren sie über PCIe 5.0 x16; das eignet sich besser für ein Modell oder ein Team pro Karte als für ein über mehrere Karten verteiltes Modell, dessen All-Reduce-Operationen beim Tensor-Parallelismus dann über PCIe laufen. Die individuellen KI-Server, die wir auf Bestellung bauen, umfassen Workstations und Server mit kurzer Einbautiefe auf Threadripper-PRO- oder Xeon-W-Plattformen mit RTX-PRO-Blackwell-Workstation-Karten, mit Rack-, Strom- und Luftstromprüfung vor dem Angebot und Burn-in-Tests nach der Montage.

MIG, vGPU und Software

NVIDIAs MIG-Leitfaden vom 11. September 2026 führt die 48-GB-Karte mit zwei isolierten Instanzen 1g.24gb oder einer 2g.48gb, jeweils auch als +gfx-Variante für Grafik; die 72-GB-Karte steht noch nicht im Leitfaden, und ihr Datenblatt nennt zwei Instanzen zu 36 GB. Lesen Sie ihre Profilnamen daher nach dem Aktivieren des MIG-Modus mit nvidia-smi mig -lgip aus. MIG braucht Linux, Treiber 575.51.03 oder neuer, ein vBIOS 98.02.73.00.00 oder neuer auf der 48-GB-Karte und den mit DisplayModeSelector 1.72 oder neuer auf Compute umgestellten Anzeigemodus, bei der 72-GB-Karte laut NVIDIA-Mitarbeitern mit Version 1.76 oder neuer. Die Karte steuert dann kein Display mehr an, und laut NVIDIA muss das System für diesen Modus qualifiziert sein.

vGPU gibt es nur für die 72-GB-Karte, ab vGPU 20.2 vom August 2026, und Stand September 2026 führen NVIDIAs Support-Matrizen sie nur für Red Hat Enterprise Linux mit KVM 9.6; für VMware vSphere nennen sie von den RTX-PRO-Blackwell-Karten nur die Server Editions der RTX PRO 6000 und 4500. Die Karte hat die Compute Capability 12.0: NVIDIAs Datenblatt nennt CUDA 12.8, und PyTorch hat die Unterstützung für Blackwell in Release 2.7 mit Wheels für CUDA 12.8 eingeführt; prüfen Sie daher zuerst Container, die auf älteren CUDA-Versionen aufbauen.

Wo sie passt, und wo nicht

Die Messungen sprechen für die RTX PRO 5000 als Karte für Rendering und Video, deutlich vor der RTX 5000 Ada und in Topaz Video nicht mehr als 19 Prozent hinter der RTX PRO 6000 Workstation Edition, bei halber Leistungsaufnahme. Bei Sprachmodellen beruht das Argument für sie auf Speicher und Rechnung: 48 GB für Modelle bis 32B in FP8 oder ein 70B-Modell in 4 Bit für einen oder zwei Nutzer, 72 GB für gpt-oss-120b oder ein 70B-Modell in 4 Bit, das ein kleines Team bedient.

Für ein 70B-Modell in FP8 ist sie die falsche Karte: Neben seinen 68 GiB Gewichten lassen 72 GB zu wenig Platz für die Laufzeitumgebung und für den Cache, den eine sinnvolle Zahl gleichzeitiger Anfragen braucht. Die neue RTX PRO 5500 mit 84 GB fasst ein solches Modell mit wenig Cache, die RTX PRO 6000 mit 96 GB mit mehr. Die falsche Karte ist sie auch für vGPU außerhalb von Red Hat KVM 9.6, für einen reinen CAD-Arbeitsplatz und für ein Modell, das für eine Karte zu groß ist und ohne NVLink über PCIe aufgeteilt werden muss. Bei denselben 300 W bringt die RTX PRO 6000 Max-Q 96 GB, 1.792 GB/s und 3.511 AI TOPS mit, und die 72-GB-Karte lag in Pugets Topaz-Test 7 Prozent unter ihr; ob sich dieser Schritt lohnt, hängt vom Modell und vom Budget ab.

Was wir liefern

Eurokommerz liefert die RTX PRO 5000 Blackwell in beiden Speichergrößen EU-weit, mit Herstellergarantie sowie EU-Vertrag und EU-Rechnung, als einzelne Karte oder in einer konfigurierten Workstation; siehe den Katalogeintrag. Für die Plattform darüber liefert unser Engineering-Partner Vixen.UNO KI/ML-Integration: private LLMs bei Ihnen vor Ort mit vLLM, Ollama oder NVIDIA AI Enterprise, RAG-Assistenten, die die Zugriffsrechte jedes Nutzers beachten, und ein Pilotprojekt auf einem Prozess mit klaren Metriken, bei dem nur skaliert wird, was seinen Wert bewiesen hat. Der Vertrag bleibt bei Eurokommerz.

FAQ

Wie viele Token pro Sekunde generiert die RTX PRO 5000?
Wir haben für die Desktop-Karte keinen veröffentlichten Wert gefunden, der die Engine und ihre Version, die Präzision, die Zahl gleichzeitiger Anfragen und das Testsystem nennt; Phoronix und Puget Systems geben ihre Token-Raten für Sprachmodelle nur in Diagrammen an. Nach unserer Rechnung begrenzen ihre 1.344 GB/s einen einzelnen Stream ohne spekulatives Dekodieren auf etwa 33 Token pro Sekunde bei Llama 3.3 70B in NVFP4 und auf etwa 70 bei Qwen3-32B in NVFP4, und reale Engines bleiben unter dieser Obergrenze.
Ist die RTX PRO 5000 mit 72 GB schneller als die Version mit 48 GB?
Nein. Laut Puget Systems lagen die beiden in Topaz Video 1.6.1 innerhalb seiner Messtoleranz und im Modell Starlight Mini von Topaz weniger als 1 Prozent auseinander. Die 72-GB-Karte hilft nur, wenn ein Modell, sein Cache oder eine Szene den Speicher braucht.
Wie viel schneller ist die RTX PRO 5000 als die RTX 5000 Ada?
Im Vergleichstest von Puget Systems vom Dezember 2025 war sie in Octane 58 Prozent schneller, in Blender 50 Prozent, in V-Ray GPU 35 Prozent, in Topaz Video AI 25 Prozent und in Unreal Engine 18 Prozent. In V-Ray GPU schlug sie außerdem die RTX 6000 Ada um 11 Prozent.
Wie schlägt sich die RTX PRO 5000 im Vergleich zur RTX PRO 6000?
In Pugets Test mit Topaz Video 1.6.1 vom August 2026 war die 48-GB-Karte 19 Prozent langsamer als die RTX PRO 6000 Workstation Edition mit 600 W und die 72-GB-Karte 7 Prozent langsamer als die Max-Q mit 300 W. Auf dem Papier hat sie drei Viertel der Bandbreite dieser beiden Karten, etwa die Hälfte der FP4-Tensor-Spitzenleistung der Workstation Edition und 48 oder 72 GB gegenüber 96 GB.
Unterstützt die RTX PRO 5000 MIG und vGPU?
MIG teilt jede der beiden Versionen in zwei Instanzen, zu je 24 GB auf der 48-GB-Karte und laut ihrem Datenblatt zu je 36 GB auf der 72-GB-Karte, die NVIDIAs MIG-Leitfaden noch nicht führt. MIG braucht Linux, Treiber 575.51.03 oder neuer, ein Mindest-vBIOS (98.02.73.00.00 auf der 48-GB-Karte) und den auf Compute umgestellten Anzeigemodus. vGPU gibt es nur für die 72-GB-Karte, ab vGPU 20.2 und nur unter Red Hat Enterprise Linux mit KVM 9.6, laut NVIDIAs Support-Matrix vom 22. September 2026.
Gelten Tests der Laptop-Version der RTX PRO 5000 für die Desktop-Karte?
Nein. NVIDIAs RTX PRO 5000 Blackwell für Laptops hat 10.496 CUDA-Kerne, 24 GB und 896 GB/s bei 95 bis 175 W, die Desktop-Karte dagegen 14.080 Kerne, 48 oder 72 GB und 1.344 GB/s bei 300 W. Ergebnisse der einen sagen nichts über die andere aus.

Nennen Sie uns die Modelle und die Präzision, die Sie einsetzen wollen, und wie viele Personen sie gleichzeitig nutzen werden, oder Ihren Renderer und Ihre größte Szene. Wir sagen Ihnen, ob die RTX PRO 5000 mit 48 GB oder die mit 72 GB passt oder eine andere Karte, und konfigurieren die Workstation um die Karte herum. Wir antworten innerhalb eines Werktages.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at  ·  +43 1 585 1405 50  ·  Jordangasse 7, 1010 Wien