RTX PRO 6000 Blackwell vs. GeForce RTX 5090 für KI-Arbeit: was die zusätzlichen 64 GB bringen und was nicht
- Beide Karten übertragen Daten mit 1.792 GB/s über einen 512 Bit breiten GDDR7-Bus; bei einem Modell, das auf beide passt, läuft die Token-Generierung daher ähnlich schnell
- Der Unterschied liegt in der Kapazität: 96 GB gegen 32 GB entscheiden, ob gpt-oss-120b, ein 70B-Modell in 4 Bit oder ein langer Kontext überhaupt auf eine Karte passt
- NVIDIAs Architekturtabellen nennen für BF16 mit FP32-Akkumulation 503,8 dichte TFLOPS auf der RTX PRO 6000 und 209,5 auf der 5090: die 2,4-fache Rate für die Berechnungen, die beim Training anfallen
- Laut NVIDIAs Treiberlizenz ist GeForce-Software nicht für den Einsatz im Rechenzentrum lizenziert („is not licensed for datacenter deployment“), und NVIDIAs Garantie für seine eigenen GeForce-Karten erlischt bei Nutzung im Rechenzentrum
- Die RTX PRO bringt MIG mit bis zu vier Instanzen und Enterprise-Treiber mit; NVIDIA-Mitarbeiter geben an, dass Karten der GeForce-RTX-50-Serie keine Peer-to-Peer-Transfers zwischen GPUs unterstützen
Eine Chipfamilie, zwei Produkte
Die GeForce RTX 5090 und die RTX PRO 6000 Blackwell stammen aus derselben Generation und teilen die Compute Capability 12.0, derselbe CUDA-Code läuft also auf beiden. NVIDIA aktiviert 170 Streaming-Multiprozessoren auf der 5090 und 188 auf der RTX PRO 6000 und gibt der Profikarte am selben 512-Bit-Bus dreimal so viel Speicher.
| SPEZIFIKATION | GEFORCE RTX 5090 | RTX PRO 6000 WORKSTATION | RTX PRO 6000 MAX-Q |
|---|---|---|---|
| CUDA-Kerne | 21.760 | 24.064 | 24.064 |
| Speicher | 32 GB GDDR7, 512 Bit | 96 GB GDDR7 mit ECC, 512 Bit | 96 GB GDDR7 mit ECC, 512 Bit |
| Bandbreite | 1.792 GB/s | 1.792 GB/s | 1.792 GB/s |
| L2-Cache | 96 MB | 128 MB | 128 MB |
| Boost-Takt | 2.407 MHz | 2.617 MHz | 2.280 MHz |
| Leistungsaufnahme | 575 W | 600 W | 300 W |
| AI TOPS (FP4 mit Sparsity) | 3.352 | 4.000 | 3.511 |
| Video-Encoder und -Decoder | 3 und 2 | 4 und 4 | 4 und 4 |
| Displayausgänge | 3× DisplayPort 2.1b, 1× HDMI 2.1b | 4× DisplayPort 2.1b | 4× DisplayPort 2.1b |
| MIG | nein | bis zu 4 Instanzen | bis zu 4 Instanzen |
| NVLink | nein | nein | nein |
NVIDIA-Produktseiten und -Datenblätter; Boost-Takte, L2-Cache und die Bandbreite der 5090 aus NVIDIAs Architektur-Whitepapers zu RTX Blackwell (GeForce) und RTX PRO Blackwell. NVIDIA führt für die RTX PRO 6000 kein NVLink auf; Lenovos Product Guides zur Max-Q und zur Server Edition vermerken „NVLink-Unterstützung: Nein“.
Die dritte Edition, gedacht fürs Rack, ist die Server Edition: dieselben 96 GB, passive Kühlung, 1.597 GB/s und vGPU-Unterstützung. Sie ist die einzige Edition, die für ein Servergehäuse gebaut ist, und das spielt für die Lizenzfrage weiter unten eine Rolle.
Wo beide ähnlich schnell sind
Für jedes erzeugte Token wird jedes aktive Gewicht einmal gelesen; die Generierungsgeschwindigkeit für einen einzelnen Nutzer folgt also der Speicherbandbreite, und beide Karten haben dieselben 1.792 GB/s. Unabhängige Tests bestätigen das weitgehend. In StorageReviews Läufen des Textgenerierungs-Benchmarks von UL Procyon, der TensorRT nutzt, lag die RTX PRO 6000 bei vier Modellen, die auf beide Karten passen, zwischen 3,6 und 8,2 Prozent vor der 5090. GamersNexus, das nach eigener Aussage mit LLM-Tests noch experimentiert, maß bei einem 8B-Modell auf beiden dieselben 81 Token pro Sekunde, bei Phi-4, Qwen 2.5 und InternLM 22 bis 25 Prozent mehr für die RTX PRO 6000 und weit mehr bei Mistral Small (26 GB) und Gemma 3 27B, die nahe an die 32 GB der 5090 heranreichen. Bei einem Modell, das bequem in 32 GB passt, und jeweils einem Nutzer ist die größere Karte höchstens etwa ein Viertel schneller.
Die Ausnahme ist der Betrieb unter Last. Bei vielen gleichzeitigen Anfragen nimmt der Speicher, der nach den Gewichten frei bleibt, den KV-Cache auf, und der Cache entscheidet, wie viele Anfragen parallel laufen. CloudRift, ein GPU-Cloud-Anbieter, betrieb ein 30B-Codemodell in 4 Bit mit vLLM bei hoher Parallelität und maß 8.425 Token pro Sekunde auf einer RTX PRO 6000 gegenüber 4.570 auf einer 5090: dasselbe Modell auf beiden Karten, aber auf der größeren Platz für weit mehr Gespräche.
Jenseits von Sprachmodellen gilt dasselbe. In StorageReviews Rendering-Läufen lag die 5090 in V-Ray mit 14.764 vpaths gegenüber 12.128 vorn und erzeugte ein SDXL-Bild in 5,2 Sekunden gegenüber 5,4, während Blender in die andere Richtung ausschlug: 7.870 Samples pro Minute gegenüber 7.421. Am Schreibtisch mit einem Grafiker oder einem Entwickler und mittelgroßen Modellen ist die GeForce-Karte nicht die langsame Wahl.
Wo 32 GB nicht mehr reichen
Das Bild ändert sich, sobald das Modell der kleineren Karte entwächst. gpt-oss-120b ist 60,8 GiB groß, ein 70B-Modell in 4 Bit braucht schon ohne Kontext etwa 40 GiB, und keines von beiden lässt sich in 32 GB laden, ohne in den Systemspeicher auszuweichen. GamersNexus ließ Llama 3.3 70B in einer 4-Bit-Quantisierung auf beiden laufen und maß für die RTX PRO 6000 ein Plus von 928 Prozent gegenüber der 5090: die Folge eines Modells, das nicht passt, kein Unterschied im Silizium. StorageReview maß 163,1 Token pro Sekunde auf der RTX PRO 6000 bei gpt-oss-120b und 31,7 bei Llama 3.3 70B, Läufe, die die 5090 allein nicht schafft.
| ARBEITSLAST | GEWICHTE | RTX 5090, 32 GB | RTX PRO 6000, 96 GB |
|---|---|---|---|
| 8B-Modell, BF16 | etwa 16 GB | passt | passt |
| 32B-Modell, 4 Bit | etwa 18 GB | passt, kurzer Kontext | passt, langer Kontext |
| 70B-Modell, 4 Bit (NVFP4) | 40 GiB | passt nicht | passt, mit Platz für Nutzer |
| gpt-oss-120b (MXFP4) | 60,8 GiB | passt nicht | passt |
| 70B-Modell, FP8 | 68 GiB | passt nicht | passt, FP8-Cache für etwa vierzehn 8k-Gespräche |
Nur Gewichte. Die 70B-Werte gelten für Llama 3.3 70B aus unserem 70B-Rechenbeispiel; gpt-oss-120b laut OpenAIs Model Card. KV-Cache und Laufzeitumgebung kommen hinzu.
Mehrere 5090 statt einer RTX PRO 6000?
Das ist der naheliegende Ausweg, und beim reinen Durchsatz kann er gewinnen. Im selben CloudRift-Test erreichte Llama 3.3 70B in 4 Bit, mit vLLM bei hoher Parallelität betrieben, 1.230 Token pro Sekunde auf zwei 5090 gegenüber 1.031 auf einer RTX PRO 6000; vier 5090 erreichten bei einem 30B-Codemodell 12.744 gegenüber 8.425 auf einer RTX PRO 6000. Die Nachteile tauchen im Benchmark nicht auf. Zwei 5090 sind für 1.150 W Leistungsaufnahme spezifiziert, eine RTX PRO 6000 für 600 W, das Modell muss auf die Karten aufgeteilt werden, und NVIDIA-Mitarbeiter geben an, dass Peer-to-Peer-Transfers zwischen Karten der GeForce-RTX-50-Serie nicht unterstützt werden, sodass jeder Austausch zwischen ihnen über den Host läuft. Die Lizenz weiter unten gilt für jede von ihnen.
Die Zahl, die fürs Training zählt: FP32-Akkumulation
Tensor-Kerne multiplizieren Zahlen niedriger Präzision und addieren die Produkte in einen Akkumulator. Mixed-Precision-Training hält diesen Akkumulator der Genauigkeit wegen in FP32; PyTorch dokumentiert FP16-Akkumulation als Opt-in, das numerische Präzision gegen Geschwindigkeit tauscht, und NVIDIAs Whitepapers führen BF16 nur mit FP32-Akkumulation auf. In dieser Zeile trennen sich die Wege der beiden Produkte.
| DICHTER SPITZENWERT | RTX 5090 | RTX PRO 6000 WORKSTATION | RTX PRO 6000 MAX-Q |
|---|---|---|---|
| FP16, FP16-Akkumulation | 419 TFLOPS | 503,8 TFLOPS | 438,9 TFLOPS |
| FP16/BF16, FP32-Akkumulation | 209,5 TFLOPS | 503,8 TFLOPS | 438,9 TFLOPS |
| FP8, FP32-Akkumulation | 419 TFLOPS | 1.007,6 TFLOPS | 877,9 TFLOPS |
| FP4 | 1.676 TFLOPS | 2.015,2 TFLOPS | 1.755,7 TFLOPS |
| INT8 | 838 TOPS | 1.007,6 TOPS | 877,9 TOPS |
Whitepaper „NVIDIA RTX Blackwell GPU Architecture“ v1.1, Tabelle 3, und Whitepaper „RTX PRO Blackwell GPU Architecture“ v1.0, Tabelle 4. Spitzenraten beim Boost-Takt, ohne Sparsity.
Die GeForce-Karte rechnet Tensor-Operationen mit FP32-Akkumulation bei halber Rate: 209,5 TFLOPS gegenüber 419 mit FP16-Akkumulation. Die RTX PRO 6000 rechnet beides bei voller Rate. Geteilt durch Streaming-Multiprozessoren und Takt ergeben die Tabellen für beide Produkte bei voller Rate dieselben 1.024 dichten FP16-Operationen pro Multiprozessor und Takt, was eher auf eine Produktentscheidung als auf einen Unterschied in den Tensor-Kernen hindeutet. Das Ergebnis ist die 2,4-fache BF16- und FP8-Spitzenrate mit FP32-Akkumulation auf der Workstation Edition und die 2,1-fache auf der 300-W-Max-Q, während sich FP4 und INT8, die die 5090 bei voller Rate rechnet, auf der Workstation Edition nur um den Faktor 1,2 und auf der Max-Q um den Faktor 1,05 unterscheiden.
Für Inferenz, die in FP4 oder INT8 rechnet, Aktivierungen eingeschlossen, spielt diese Tabelle kaum eine Rolle; Formate wie AWQ, die nur die Gewichte in 4 Bit speichern, rechnen ihre Matrixoperationen weiterhin in 16 Bit, und die Generierung für einen einzelnen Nutzer ist ohnehin durch die Speicherbandbreite begrenzt. Für Fine-Tuning, für alles, was trainiert, und für BF16-Arbeit allgemein ist dies der größte Leistungsunterschied zwischen den beiden Karten, und in den beworbenen AI-TOPS-Werten, die auf beiden Karten FP4-Angaben sind, ist er unsichtbar.
Lizenz und Garantie
An dieser Klausel entscheidet sich der Servereinsatz. NVIDIAs Treiberlizenz, das „NVIDIA Driver License Agreement“ vom 25. Februar 2025, legt in Abschnitt 2.8 fest, dass GeForce- und Titan-Software nur für die Nutzung auf eigener GeForce- oder Titan-Hardware lizenziert ist („is licensed for use only on GeForce or Titan hardware products you own“) und nicht für den Einsatz im Rechenzentrum („is not licensed for datacenter deployment“). Abschnitt 2.7 desselben Vertrags ist nicht auf GeForce beschränkt und schließt aus, die Software zu nutzen, um kommerzielle Hosting-Dienste zu erbringen („provide commercial hosting services“), sofern der Vertrag dies nicht ausdrücklich gestattet. NVIDIAs Garantie für seine eigenen GeForce-Karten ergänzt, dass sie „intended for consumer end user purposes only“ sind, nicht für „datacenter use and/or GPU cluster commercial deployments“, und dass eine solche Nutzung die Garantie erlöschen lässt („shall void this warranty“). Die Lizenz definiert den Begriff Rechenzentrum nicht, sodass die Frage, wo genau die Grenze verläuft, eine Rechtsfrage ist; ein Rack mit GeForce-Karten im Dienst eines Unternehmens ist die Art von Nutzung, auf die die Klausel zu zielen scheint. NVIDIAs eigene Garantie für RTX-PRO-Workstation-Karten läuft drei Jahre und enthält keinen solchen Ausschluss; für eine über einen Boardpartner gekaufte Karte gelten die Bedingungen dieses Partners.
MIG, ECC, Treiber und Peer-to-Peer
MIG. Die RTX PRO 6000 teilt sich in bis zu vier isolierte Instanzen zu 24 GB oder zwei zu 48 GB, unter Linux mit Treiber 575.51.03 oder neuer, einem aktuellen vBIOS (98.02.55.00.00 oder neuer auf der Workstation Edition, 98.02.6A.00.00 auf der Max-Q) und auf Compute umgestelltem Anzeigemodus. Die 5090 lässt sich nicht aufteilen. Für ein Team, das sich eine Karte teilt, ist das der Unterschied zwischen einer Warteschlange und vier eigenen GPUs; unser Leitfaden zu MIG und vGPU enthält die Details. vGPU ist eine andere Frage: Weder die 5090 noch die Editionen Workstation und Max-Q stehen auf NVIDIAs vGPU-Liste; vGPU ist Sache der Server Edition.
ECC. Die RTX PRO 6000 wird mit ECC-geschütztem GDDR7 beworben. NVIDIAs GeForce-Whitepaper erklärt, dass GDDR7 ECC im Speicherchip selbst mitbringt und dass es „auf GeForce-RTX-GPUs mit GDDR7-Speicher immer aktiviert“ ist. NVIDIA veröffentlicht nicht, worin sich die Umsetzung bei der Profikarte unterscheidet, daher ist ECC allein in dieser Generation ein schwächeres Argument als bei GDDR6.
Treiber. Die RTX PRO nutzt NVIDIAs RTX-Enterprise-Treiber mit ISV-Zertifizierungen; die 5090 nutzt Game-Ready- und Studio-Treiber. Für CAD, Simulation und alles mit einer Liste zertifizierter Anwendungen zählt nur Ersteres.
Peer-to-Peer. In einer Forenantwort vom März 2025 nannten NVIDIA-Mitarbeiter „Quadro RTX und Rechenzentrums-GPUs“ als die Klassen, die Peer-to-Peer-Transfers unterstützen, und schlossen Karten der GeForce-RTX-50-Serie aus; NVIDIAs Produktdokumente geben die Peer-to-Peer-Unterstützung nicht Karte für Karte an. Lesen Sie bei einem Aufbau mit mehreren Karten auch NVIDIAs NCCL-Hinweise: IOMMU-Übersetzung unter Linux auf Bare Metal legt PCIe-Peer-to-Peer lahm, die BIOS-Einstellungen sind also ebenso wichtig wie die Karte.
Wann die 5090 genügt und wann nicht
Die 5090 ist eine vernünftige Wahl für eine Person am Schreibtisch, die mit Modellen bis etwa 32B in 4 Bit arbeitet, für Bildgenerierung und für GPU-Rendering, wo sie so schnell ist wie die Profikarte und manchmal schneller. Zur RTX PRO 6000 greifen Sie, wenn Modell oder Kontext mehr als 32 GB brauchen, wenn die Arbeit Training oder Fine-Tuning in BF16 oder FP8 umfasst, wenn sich mehrere Personen die Karte per MIG teilen, wenn ein zertifizierter Treiber verlangt wird und immer dann, wenn die Maschine in einem Serverraum steht. Für den letzten Fall ist die Server Edition, nicht die Workstation-Karte, die Edition, die Sie kaufen sollten.
Was wir liefern
Eurokommerz liefert die RTX PRO 6000 Blackwell in allen drei Editionen, Workstation, Max-Q und Server, EU-weit mit Herstellergarantie, einzeln oder in einer konfigurierten Workstation oder einem konfigurierten Server. Für mehrere Karten in einer Maschine am Arbeitsplatz lesen Sie vier Max-Q-Karten in einer Workstation; für das Rack unseren Editionsvergleich.
FAQ
Ist die RTX PRO 6000 schneller als die RTX 5090?
Lassen sich RTX-5090-Karten in einem Server einsetzen?
Warum hat die RTX PRO 6000 bei gleicher Bandbreite mehr Rechenleistung für Fine-Tuning?
Hat die RTX 5090 ECC-Speicher?
Können zwei RTX 5090 eine RTX PRO 6000 ersetzen?
Lässt sich eine RTX PRO 6000 zwischen mehreren Nutzern teilen?
Nennen Sie uns die Modelle, die Präzision und den Ort, an dem die Maschine laufen wird: Schreibtisch, Labor oder Serverraum. Wir sagen Ihnen, ob eine GeForce-Karte genügt oder welche Edition der RTX PRO 6000 passt. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages