RTX PRO 4500 Server vs RTX PRO 6000 Server: acht kleinere oder vier größere Karten je Server
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Acht Karten der RTX PRO 4500 Server Edition geben einem Server 256 GB GPU-Speicher in acht Pools mit je 32 GB bei 1.320 W Leistungsaufnahme; vier Karten der RTX PRO 6000 Server Edition geben 384 GB in vier Pools mit je 96 GB bei bis zu 2.400 W, und keine der beiden Karten hat NVLink
- Die summierte Speicherbandbreite ist fast gleich, 6.400 GB/s gegenüber 6.388 GB/s, und beide Server kommen auf 16 MIG-Instanzen, mit 16 GB auf der kleineren Karte und mit 24 GB auf der größeren
- Modelle bis rund 20 GiB Gewichte laufen auf einer Karte beider Typen, während Llama 3.3 70B in FP8 auf eine RTX PRO 6000 passt, aber vier RTX PRO 4500 braucht, über PCIe verteilt
- Acht kleinere Karten passen zu vielen kleinen Modellen, Embeddings und Videoanalyse, mit 24 Videodecodern gegenüber 16; vier größere Karten passen zu einem oder zwei Modellen der 70B-Klasse mit einer Kopie je Karte
- Wo NVIDIA AI Enterprise eingesetzt wird, wird es pro GPU lizenziert, acht Karten brauchen also acht Lizenzen und vier Karten vier; keine der beiden Karten enthält ein Abonnement, und Lizenzen für vWS und vPC werden pro gleichzeitigem Nutzer gezählt
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
RTX PRO 4500 Server vs RTX PRO 6000 Server: die Kurzfassung
Acht Karten der RTX PRO 4500 Blackwell Server Edition geben einem Server 256 GB GPU-Speicher in acht Pools mit je 32 GB. Vier Karten der RTX PRO 6000 Blackwell Server Edition geben ihm 384 GB in vier Pools mit je 96 GB. Die Wahl bestimmen das größte Modell, das auf eine Karte passen muss, die Zahl getrennter Workloads, die Größen der MIG-Instanzen, der Strom an der Rackposition und die Gehäuse, die der Serverhersteller für jede Karte aufführt.
Viele kleine Modelle, Embeddings und Video-Streams sprechen für acht kleinere Karten, ein oder zwei Modelle der 70B-Klasse für vier größere. Lenovos Produktleitfäden führen „NVLink support“ für beide Karten mit „No“; ein Modell, das nicht auf eine Karte passt, wird also in beiden Servern über PCIe verteilt. Details zur Karte selbst stehen in unserem Leitfaden zur RTX PRO 4500 Blackwell Server Edition.
Die beiden Konfigurationen nebeneinander
| MERKMAL | JE RTX PRO 4500 SE | 8 × RTX PRO 4500 SE | JE RTX PRO 6000 SE | 4 × RTX PRO 6000 SE |
|---|---|---|---|---|
| GPU-Speicher | 32 GB GDDR7 | 256 GB in 8 Pools | 96 GB GDDR7 | 384 GB in 4 Pools |
| Speicherbandbreite | 800 GB/s | 6.400 GB/s summiert | 1.597 GB/s | 6.388 GB/s summiert |
| CUDA-Kerne | 10.496 | 83.968 | 24.064 | 96.256 |
| FP4 Tensor Core | 1,6 PFLOPS | 12,8 PFLOPS | 4 PFLOPS | 16 PFLOPS |
| FP8 Tensor Core | 811 TFLOPS | 6.488 TFLOPS | 2 PFLOPS | 8 PFLOPS |
| NVENC und NVDEC | 3 und 3 | 24 und 24 | 4 und 4 | 16 und 16 |
| MIG-Instanzen, maximal | 2 × 16 GB | 16 × 16 GB | 4 × 24 GB | 16 × 24 GB |
| Leistungsaufnahme | 165 W | 1.320 W | 300 bis 600 W | 1.200 bis 2.400 W |
| Slotbreite, Kühlung | Single-Slot, passiv | 8 Steckplätze einfacher Breite | Dual-Slot, passiv | 4 Steckplätze doppelter Breite |
| AI-Enterprise-Lizenzen | 1 je GPU | 8 | 1 je GPU | 4 |
SE: Server Edition. NVIDIA-Produktseiten beider Karten; NVIDIA-MIG-Benutzerhandbuch (11. September 2026); NVIDIA Product Brief SP-12355-001_v02 für den Bereich von 300 bis 600 W; NVIDIA-AI-Enterprise-Lizenzleitfaden (2. September 2026); alle abgerufen am 10. Oktober 2026. Die Serversummen sind unsere Rechnung.
Die vier größeren Karten haben 50 Prozent mehr Speicher und nach NVIDIAs Angaben rund ein Viertel mehr FP4- und FP8-Durchsatz; die acht kleineren Karten haben 24 Decoder gegenüber 16 und ziehen 1.320 W gegenüber bis zu 2.400 W.
Je Karte hat ein Modell, das auf beide passt, auf der größeren die doppelte Speicherbandbreite. Für die RTX PRO 4500 Server Edition haben wir keinen Wert von NVIDIA in Token pro Sekunde gefunden; ihre Produktseite nennt für kleine und mittelgroße Modelle „mehr als die 5-fache Leistung der L4-GPU der vorherigen Generation“, ohne Testbedingungen.
Größtes Modell je Karte: was in 32 GB und in 96 GB passt
Nach unserer Auslegungsregel fassen 0,9 × der Speicher der Karte, abzüglich 3 GiB für Aktivierungen und die Runtime, Gewichte und Cache. Das ergibt etwa 25,7 GiB auf der Karte mit 32 GB bei ausgeschaltetem ECC und 83,0 GiB auf der RTX PRO 6000, deren Treiber 95,6 GiB meldet. Laut NVIDIAs CUDA C++ Best Practices Guide verringert sich bei GDDR-Speicher mit eingeschaltetem ECC „der verfügbare DRAM um 6,25 %“; mit eingeschaltetem ECC behält die Karte mit 32 GB also etwa 23,9 GiB, und nvidia-smi -q zeigt den Modus. Eine auf mehrere Karten verteilte Kopie legt ihren Cache zusammen, denn der vLLM-Blog vom 7. August 2026 schreibt, dass bei Grouped-Query Attention „TP den KV-Cache zuerst nach diesen Heads aufteilt“, und diese Modelle haben 8 KV-Heads.
| MODELL, PRÄZISION | GEWICHTE | AUF RTX PRO 4500 SE | AUF RTX PRO 6000 SE | KOPIEN JE SERVER |
|---|---|---|---|---|
| gpt-oss-20b, MXFP4 | 12,8 GiB | 1 Karte, mehr als 130 | 1 Karte, mehr als 700 | 8 / 4 |
| Qwen3-14B, FP8 | 15,2 GiB | 1 Karte, rund 16 | 1 Karte, rund 108 | 8 / 4 |
| Qwen3-32B, NVFP4 | 19,3 GiB | 1 Karte, rund 6 | 1 Karte, rund 63 | 8 / 4 |
| Qwen3-32B, FP8 | 32,0 GiB | 2 Karten, rund 19 | 1 Karte, rund 51 | 4 / 4 |
| Llama 3.3 70B, NVFP4 | 39,8 GiB | 2 Karten, rund 9 | 1 Karte, rund 34 | 4 / 4 |
| Llama 3.3 70B, FP8 | 67,7 GiB | 4 Karten, rund 28 | 1 Karte, rund 12 | 2 / 4 |
Unsere Schätzungen, keine Messungen: gleichzeitige Gespräche mit 8.192 Token in voller Länge je Kopie, FP8-KV-Cache, 25,7 GiB je RTX PRO 4500 (ECC aus) und 83,0 GiB je RTX PRO 6000; Kopien für acht RTX PRO 4500 / vier RTX PRO 6000. Die Gewichte sind die Checkpoints von OpenAI, Qwen und NVIDIA auf Hugging Face wie in unseren Sizing-Leitfäden; KV-Heads und Layer aus der jeweiligen config.json.
Ab Qwen3-32B in FP8 braucht es bei der kleineren Karte zwei oder vier Karten je Kopie, und Tensor-Parallelismus tauscht in jedem Layer Teilergebnisse zwischen ihnen aus, hier über PCIe. Vier RTX PRO 6000 halten je Karte eine Kopie von Llama 3.3 70B, ohne Verkehr zwischen den Karten. Acht RTX PRO 4500 halten zwei Kopien aus je vier Karten und, nach dem Speicher gerechnet, insgesamt mehr Gespräche, rund 56 gegenüber 48, weil die Gewichte zweimal statt viermal gespeichert werden. Ein Modell über 96 GB braucht auch mehrere RTX PRO 6000; unser Leitfaden zur Kartenaufteilung in einem Server mit acht RTX PRO 6000 plant diesen Server Karte für Karte.
Viele kleine Modelle und Embeddings für 500 bis 2.000 Nutzer
Mit den Beispielwerten unseres Leitfadens nach Unternehmensgröße ergeben 500 Mitarbeiter zur Spitze rund 20 Anfragen in Bearbeitung und 2.000 Mitarbeiter rund 80; dieselben Werte ergeben für 1.000 Mitarbeiter rund 40. Ein Modell der 14B-Klasse auf einer RTX PRO 4500 hält mit eingeschaltetem ECC rund 13 Gespräche in voller Länge mit 8K, Kopien auf vier Karten halten also rund 52, genug für 1.000 Mitarbeiter, und sieben Karten erreichen die 80 von 2.000 Mitarbeitern (drei und fünf Karten ohne ECC). Auf einer RTX PRO 6000 hat dasselbe Modell Platz für rund 108, mehr als die größte Beispielspitze.
Dieser Überschuss spricht für kleinere Karten, wenn ein Server viele Modelle überschaubarer Größe trägt: einen Assistenten, ein Coding-Modell, Embedding und Reranking für RAG, Spracherkennung und Modelle je Abteilung, jedes mit eigenen Nutzern und eigenem Update-Zyklus. Acht Karten bieten acht Plätze für eine Engine mit eigenem Speicher und eigenem Neustart; bei vier teilen sich die übrigen eine Karte über MIG oder mehrere Engine-Instanzen, wie unser Leitfaden zum Betrieb mehrerer Modelle auf einem GPU-Server erklärt. Eine ausgefallene Karte nimmt im einen Server ein Achtel des GPU-Speichers außer Betrieb und im anderen ein Viertel.
Wir bauen KI-Server mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Schicken Sie uns die geplanten Modelle und die Nutzer jedes Modells über das Formular unten, und wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot.
MIG auf beiden Karten: zwei Instanzen mit 16 GB oder vier mit 24 GB
NVIDIAs MIG-Benutzerhandbuch, aktualisiert am 11. September 2026, führt für die RTX PRO 4500 Blackwell zwei Größen: 1g.16gb, bis zu zweimal je Karte, jede mit der Hälfte des Speichers und der Hälfte der SMs, und 2g.32gb für die ganze Karte. Für die RTX PRO 6000 führt es 1g.24gb bis zu viermal, 2g.48gb bis zu zweimal und 4g.96gb einmal. Beide Server kommen damit auf höchstens 16 Instanzen, mit 16 GB auf acht kleineren Karten und mit 24 GB auf vier größeren.
Nach der Regel oben fasst eine Hälfte mit 16 GB NVIDIAs FP8-Checkpoint von Qwen3-8B mit 8,8 GiB samt Cache für rund vier Gespräche mit 8K (zwei bei eingeschaltetem ECC), während Qwen3-14B in FP8 mit 15,2 GiB mit Cache gar nicht hineinpasst. Eine 1g.24gb-Instanz der RTX PRO 6000 nimmt dasselbe 14B-Modell mit Cache für rund fünf Gespräche auf. Eine 1g.16gb-Instanz hat einen Videodecoder und einen Encoder, ebenso eine 1g.24gb-Instanz. Zwei einfache Hälften lassen den dritten Decoder einer RTX PRO 4500 ungenutzt, acht Karten mit 16 Hälften bieten also 16 Decoder statt 24; das Profil 1g.16gb+me.all gibt einer Hälfte alle drei.
Videoanalyse und VDI auf acht oder vier Karten
Bei Videoanalyse zählen die Decoder. NVIDIA nennt drei NVENC- und drei NVDEC-Engines je RTX PRO 4500 Server Edition und je vier pro RTX PRO 6000 Server Edition, acht kleinere Karten tragen also 24 Decoder und vier größere 16. Die Streams je Decoder hängen von Codec, Auflösung und Bildrate ab und werden mit Ihren Kameras gemessen. Passen die Erkennungsmodelle in 32 GB, bietet der Server mit acht Karten mehr Decoder bei 1.320 W Leistungsaufnahme der Karten gegenüber bis zu 2.400 W.
Für VDI stehen beide Karten auf NVIDIAs Liste der von der vGPU-Software unterstützten GPUs, aktualisiert am 2. Oktober 2026: die RTX PRO 4500 Server Edition ab Release 20.0 und die RTX PRO 6000 Server Edition ab Release 19.0. Jedes vGPU-Profil hat eine feste Framebuffer-Größe, Karten mit 32 GB und mit 96 GB teilen sich also in unterschiedlich viele Desktops einer bestimmten Größe auf. vWS, vPC und vApps werden pro gleichzeitigem Nutzer lizenziert, die Zahl der Karten ändert diese Zählung also nicht.
Strom, Steckplätze und Gehäuse: der Lenovo SR650a V4 als Beispiel
NVIDIA spezifiziert die RTX PRO 4500 Server Edition als passive Single-Slot-Karte in voller Höhe und voller Länge mit 165 W und einer Anbindung über PCIe 5.0 x16. Die luftgekühlte RTX PRO 6000 Server Edition ist eine Dual-Slot-Karte, und NVIDIAs Product Brief SP-12355-001_v02 gibt ihr einen 600-W-Modus und einen 450-W-Modus, jeweils mit einem Minimum von 300 W. Vier Karten ziehen bei 600 W 2.400 W oder bei 450 W 1.800 W. Auf 300 W begrenzt ziehen sie 1.200 W, weniger als acht RTX PRO 4500, mit geringerem Durchsatz je Karte. NVIDIAs Produktseite nennt nicht, bei welcher Leistungseinstellung ihre FP4- und FP8-Werte gelten.
Lenovos 2U-Server ThinkSystem SR650a V4 ist für beide Karten gelistet. Sein Produktleitfaden, aktualisiert am 5. Oktober 2026, nennt „Unterstützung für bis zu 4 GPUs doppelter Breite oder 8 GPUs einfacher Breite, eingebaut in den vorderen Steckplätzen.“ Lenovos Leitfaden zur RTX PRO 6000 Server Edition schreibt, dass die Karte „auf 450 W leistungsbegrenzt konfiguriert werden kann, damit 4 GPUs im SR650a V4 installiert werden können“; die 600-W-Version ist dort auf zwei beschränkt. Lenovos Leitfaden zur RTX PRO 4500 Server Edition, aktualisiert am 28. Juli 2026, hält fest: „Der SR650a V4 unterstützt die GPU jetzt“. Das Maximum je Server konnten wir in diesem Leitfaden nicht lesen, acht Karten sind deshalb im Konfigurator des Herstellers zu bestätigen.
Jede der beiden GPU-Summen allein bleibt unter den rund 3,7 kW einer einphasigen 16-A-Zuleitung bei 230 V; Prozessoren, Arbeitsspeicher und Lüfter kommen hinzu, planen Sie die Zuleitung also für den ganzen Server. Ob ein Server oder zwei dieselben Karten besser einsetzen, behandelt unser Vergleich ein 8-GPU-Server oder zwei 4-GPU-Server.
NVIDIA AI Enterprise und vGPU-Lizenzen je GPU
NVIDIAs Lizenzleitfaden, aktualisiert am 2. September 2026, schreibt, dass NVIDIA AI Enterprise „pro GPU lizenziert wird“ und dass für einen Server oder eine Workstation mit seiner Software eine Lizenz „für jede GPU erforderlich ist, die im Server oder in der Workstation installiert ist“. Wo es eingesetzt wird, brauchen acht Karten also acht Lizenzen und vier Karten vier. Der Leitfaden nennt H100 PCIe und NVL, A800 40GB Active und H200 NVL als Karten mit enthaltenem Abonnement, keine der beiden RTX PRO Server Edition. Der Leitfaden erwähnt MIG nicht; wir zählen deshalb eine Lizenz je physischer Karte, wie auch immer sie aufgeteilt ist.
CUDA, vLLM und Triton laufen ohne die Lizenz, wie unser Leitfaden zur Lizenzierung von NVIDIA AI Enterprise erklärt; ein vLLM-Server auf Bare Metal braucht deshalb in keiner der beiden Konfigurationen eine.
Welche Konfiguration für welchen Workload
| WORKLOAD | KONFIGURATION | BEGRÜNDUNG |
|---|---|---|
| Viele Modelle bis 20 GiB | 8 × RTX PRO 4500 SE | acht Karten für Engines; ein Ausfall kostet 32 GB |
| Embeddings und Reranker | beide, mit MIG | 16 Instanzen auf beiden Servern |
| 14B-Modelle je Abteilung | 4 × RTX PRO 6000 SE mit MIG | eine 24-GB-Instanz fasst ein 14B-Modell in FP8 |
| Videoanalyse | 8 × RTX PRO 4500 SE | 24 Decoder bei 1.320 W Leistungsaufnahme |
| VDI mit vWS oder vPC | beide | beide auf NVIDIAs vGPU-Liste; Profilgrößen Unterscheiden sich |
| 1 oder 2 Modelle, 70B-Klasse | 4 × RTX PRO 6000 SE | eine Kopie je Karte, kein Verkehr zwischen Karten |
| Strombegrenzte Rackposition | beide, je nach Leistungsbegrenzung | 1.320 W, oder vier RTX PRO 6000 auf 300 W begrenzt mit 1.200 W |
Unsere Lesart der Abschnitte oben; Quellen wie in den ersten beiden Tabellen.
Beschreiben Sie Ihre Modelle, Kamera-Streams oder Desktops und die Rackposition im Formular unten, und wir legen beide Konfigurationen nebeneinander aus.
Was wir liefern
Wir bauen KI-Server nach Auftrag mit acht Karten der RTX PRO 4500 Server Edition oder vier der RTX PRO 6000 Server Edition, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente und Lieferung in die ganze EU, unter einem EU-Vertrag und auf einer Rechnung. Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen, und liefern Konfiguration und Angebot innerhalb eines Werktages. Beide Karten gibt es auch allein aus unserem Sortiment professioneller GPUs, neben L40S, L4 und H200 NVL. Lizenzen für NVIDIA AI Enterprise und vGPU kommen auf dieselbe Rechnung, wo der Aufbau sie braucht.
FAQ
RTX PRO 4500 Server vs RTX PRO 6000 Server: was ist der Unterschied?
Viele kleine GPUs oder wenige große: was ist für Inferenz besser?
Was läuft auf einem Server mit 8x RTX PRO 4500 Server Edition?
Wie plane ich die GPU-Dichte für einen Inferenz-Server?
Wie viele NVIDIA-AI-Enterprise-Lizenzen braucht ein Server mit acht GPUs?
Welcher GPU-Server eignet sich für viele kleine Modelle?
Schicken Sie uns die geplanten Modelle mit ihrer Präzision, die Nutzer oder Kamera-Streams je Workload, die Desktops für vGPU und die Stromzuleitung an der Rackposition. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für acht Karten der RTX PRO 4500 oder vier der RTX PRO 6000 Server Edition und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages