BLOG · VERGLEICH ·

RTX PRO 4500 Server vs RTX PRO 6000 Server: acht kleinere oder vier größere Karten je Server

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Acht Karten der RTX PRO 4500 Server Edition geben einem Server 256 GB GPU-Speicher in acht Pools mit je 32 GB bei 1.320 W Leistungsaufnahme; vier Karten der RTX PRO 6000 Server Edition geben 384 GB in vier Pools mit je 96 GB bei bis zu 2.400 W, und keine der beiden Karten hat NVLink
  • Die summierte Speicherbandbreite ist fast gleich, 6.400 GB/s gegenüber 6.388 GB/s, und beide Server kommen auf 16 MIG-Instanzen, mit 16 GB auf der kleineren Karte und mit 24 GB auf der größeren
  • Modelle bis rund 20 GiB Gewichte laufen auf einer Karte beider Typen, während Llama 3.3 70B in FP8 auf eine RTX PRO 6000 passt, aber vier RTX PRO 4500 braucht, über PCIe verteilt
  • Acht kleinere Karten passen zu vielen kleinen Modellen, Embeddings und Videoanalyse, mit 24 Videodecodern gegenüber 16; vier größere Karten passen zu einem oder zwei Modellen der 70B-Klasse mit einer Kopie je Karte
  • Wo NVIDIA AI Enterprise eingesetzt wird, wird es pro GPU lizenziert, acht Karten brauchen also acht Lizenzen und vier Karten vier; keine der beiden Karten enthält ein Abonnement, und Lizenzen für vWS und vPC werden pro gleichzeitigem Nutzer gezählt

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

RTX PRO 4500 Server vs RTX PRO 6000 Server: die Kurzfassung

Acht Karten der RTX PRO 4500 Blackwell Server Edition geben einem Server 256 GB GPU-Speicher in acht Pools mit je 32 GB. Vier Karten der RTX PRO 6000 Blackwell Server Edition geben ihm 384 GB in vier Pools mit je 96 GB. Die Wahl bestimmen das größte Modell, das auf eine Karte passen muss, die Zahl getrennter Workloads, die Größen der MIG-Instanzen, der Strom an der Rackposition und die Gehäuse, die der Serverhersteller für jede Karte aufführt.

Viele kleine Modelle, Embeddings und Video-Streams sprechen für acht kleinere Karten, ein oder zwei Modelle der 70B-Klasse für vier größere. Lenovos Produktleitfäden führen „NVLink support“ für beide Karten mit „No“; ein Modell, das nicht auf eine Karte passt, wird also in beiden Servern über PCIe verteilt. Details zur Karte selbst stehen in unserem Leitfaden zur RTX PRO 4500 Blackwell Server Edition.

Die beiden Konfigurationen nebeneinander

MERKMALJE RTX PRO 4500 SE8 × RTX PRO 4500 SEJE RTX PRO 6000 SE4 × RTX PRO 6000 SE
GPU-Speicher32 GB GDDR7256 GB in 8 Pools96 GB GDDR7384 GB in 4 Pools
Speicher­bandbreite800 GB/s6.400 GB/s summiert1.597 GB/s6.388 GB/s summiert
CUDA-Kerne10.49683.96824.06496.256
FP4 Tensor Core1,6 PFLOPS12,8 PFLOPS4 PFLOPS16 PFLOPS
FP8 Tensor Core811 TFLOPS6.488 TFLOPS2 PFLOPS8 PFLOPS
NVENC und NVDEC3 und 324 und 244 und 416 und 16
MIG-Instanzen, maximal2 × 16 GB16 × 16 GB4 × 24 GB16 × 24 GB
Leistungs­aufnahme165 W1.320 W300 bis 600 W1.200 bis 2.400 W
Slotbreite, KühlungSingle-Slot, passiv8 Steckplätze einfacher BreiteDual-Slot, passiv4 Steckplätze doppelter Breite
AI-Enterprise-Lizenzen1 je GPU81 je GPU4

SE: Server Edition. NVIDIA-Produktseiten beider Karten; NVIDIA-MIG-Benutzerhandbuch (11. September 2026); NVIDIA Product Brief SP-12355-001_v02 für den Bereich von 300 bis 600 W; NVIDIA-AI-Enterprise-Lizenzleitfaden (2. September 2026); alle abgerufen am 10. Oktober 2026. Die Serversummen sind unsere Rechnung.

Die vier größeren Karten haben 50 Prozent mehr Speicher und nach NVIDIAs Angaben rund ein Viertel mehr FP4- und FP8-Durchsatz; die acht kleineren Karten haben 24 Decoder gegenüber 16 und ziehen 1.320 W gegenüber bis zu 2.400 W.

Je Karte hat ein Modell, das auf beide passt, auf der größeren die doppelte Speicherbandbreite. Für die RTX PRO 4500 Server Edition haben wir keinen Wert von NVIDIA in Token pro Sekunde gefunden; ihre Produktseite nennt für kleine und mittelgroße Modelle „mehr als die 5-fache Leistung der L4-GPU der vorherigen Generation“, ohne Testbedingungen.

Größtes Modell je Karte: was in 32 GB und in 96 GB passt

Nach unserer Auslegungsregel fassen 0,9 × der Speicher der Karte, abzüglich 3 GiB für Aktivierungen und die Runtime, Gewichte und Cache. Das ergibt etwa 25,7 GiB auf der Karte mit 32 GB bei ausgeschaltetem ECC und 83,0 GiB auf der RTX PRO 6000, deren Treiber 95,6 GiB meldet. Laut NVIDIAs CUDA C++ Best Practices Guide verringert sich bei GDDR-Speicher mit eingeschaltetem ECC „der verfügbare DRAM um 6,25 %“; mit eingeschaltetem ECC behält die Karte mit 32 GB also etwa 23,9 GiB, und nvidia-smi -q zeigt den Modus. Eine auf mehrere Karten verteilte Kopie legt ihren Cache zusammen, denn der vLLM-Blog vom 7. August 2026 schreibt, dass bei Grouped-Query Attention „TP den KV-Cache zuerst nach diesen Heads aufteilt“, und diese Modelle haben 8 KV-Heads.

MODELL, PRÄZISIONGEWICHTEAUF RTX PRO 4500 SEAUF RTX PRO 6000 SEKOPIEN JE SERVER
gpt-oss-20b, MXFP412,8 GiB1 Karte, mehr als 1301 Karte, mehr als 7008 / 4
Qwen3-14B, FP815,2 GiB1 Karte, rund 161 Karte, rund 1088 / 4
Qwen3-32B, NVFP419,3 GiB1 Karte, rund 61 Karte, rund 638 / 4
Qwen3-32B, FP832,0 GiB2 Karten, rund 191 Karte, rund 514 / 4
Llama 3.3 70B, NVFP439,8 GiB2 Karten, rund 91 Karte, rund 344 / 4
Llama 3.3 70B, FP867,7 GiB4 Karten, rund 281 Karte, rund 122 / 4

Unsere Schätzungen, keine Messungen: gleichzeitige Gespräche mit 8.192 Token in voller Länge je Kopie, FP8-KV-Cache, 25,7 GiB je RTX PRO 4500 (ECC aus) und 83,0 GiB je RTX PRO 6000; Kopien für acht RTX PRO 4500 / vier RTX PRO 6000. Die Gewichte sind die Checkpoints von OpenAI, Qwen und NVIDIA auf Hugging Face wie in unseren Sizing-Leitfäden; KV-Heads und Layer aus der jeweiligen config.json.

Ab Qwen3-32B in FP8 braucht es bei der kleineren Karte zwei oder vier Karten je Kopie, und Tensor-Parallelismus tauscht in jedem Layer Teilergebnisse zwischen ihnen aus, hier über PCIe. Vier RTX PRO 6000 halten je Karte eine Kopie von Llama 3.3 70B, ohne Verkehr zwischen den Karten. Acht RTX PRO 4500 halten zwei Kopien aus je vier Karten und, nach dem Speicher gerechnet, insgesamt mehr Gespräche, rund 56 gegenüber 48, weil die Gewichte zweimal statt viermal gespeichert werden. Ein Modell über 96 GB braucht auch mehrere RTX PRO 6000; unser Leitfaden zur Kartenaufteilung in einem Server mit acht RTX PRO 6000 plant diesen Server Karte für Karte.

Viele kleine Modelle und Embeddings für 500 bis 2.000 Nutzer

Mit den Beispielwerten unseres Leitfadens nach Unternehmensgröße ergeben 500 Mitarbeiter zur Spitze rund 20 Anfragen in Bearbeitung und 2.000 Mitarbeiter rund 80; dieselben Werte ergeben für 1.000 Mitarbeiter rund 40. Ein Modell der 14B-Klasse auf einer RTX PRO 4500 hält mit eingeschaltetem ECC rund 13 Gespräche in voller Länge mit 8K, Kopien auf vier Karten halten also rund 52, genug für 1.000 Mitarbeiter, und sieben Karten erreichen die 80 von 2.000 Mitarbeitern (drei und fünf Karten ohne ECC). Auf einer RTX PRO 6000 hat dasselbe Modell Platz für rund 108, mehr als die größte Beispielspitze.

Dieser Überschuss spricht für kleinere Karten, wenn ein Server viele Modelle überschaubarer Größe trägt: einen Assistenten, ein Coding-Modell, Embedding und Reranking für RAG, Spracherkennung und Modelle je Abteilung, jedes mit eigenen Nutzern und eigenem Update-Zyklus. Acht Karten bieten acht Plätze für eine Engine mit eigenem Speicher und eigenem Neustart; bei vier teilen sich die übrigen eine Karte über MIG oder mehrere Engine-Instanzen, wie unser Leitfaden zum Betrieb mehrerer Modelle auf einem GPU-Server erklärt. Eine ausgefallene Karte nimmt im einen Server ein Achtel des GPU-Speichers außer Betrieb und im anderen ein Viertel.

Wir bauen KI-Server mit 2 bis 8 GPUs je Knoten, ausgelegt nach Modellgröße und gleichzeitigen Nutzern. Schicken Sie uns die geplanten Modelle und die Nutzer jedes Modells über das Formular unten, und wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot.

MIG auf beiden Karten: zwei Instanzen mit 16 GB oder vier mit 24 GB

NVIDIAs MIG-Benutzerhandbuch, aktualisiert am 11. September 2026, führt für die RTX PRO 4500 Blackwell zwei Größen: 1g.16gb, bis zu zweimal je Karte, jede mit der Hälfte des Speichers und der Hälfte der SMs, und 2g.32gb für die ganze Karte. Für die RTX PRO 6000 führt es 1g.24gb bis zu viermal, 2g.48gb bis zu zweimal und 4g.96gb einmal. Beide Server kommen damit auf höchstens 16 Instanzen, mit 16 GB auf acht kleineren Karten und mit 24 GB auf vier größeren.

Nach der Regel oben fasst eine Hälfte mit 16 GB NVIDIAs FP8-Checkpoint von Qwen3-8B mit 8,8 GiB samt Cache für rund vier Gespräche mit 8K (zwei bei eingeschaltetem ECC), während Qwen3-14B in FP8 mit 15,2 GiB mit Cache gar nicht hineinpasst. Eine 1g.24gb-Instanz der RTX PRO 6000 nimmt dasselbe 14B-Modell mit Cache für rund fünf Gespräche auf. Eine 1g.16gb-Instanz hat einen Videodecoder und einen Encoder, ebenso eine 1g.24gb-Instanz. Zwei einfache Hälften lassen den dritten Decoder einer RTX PRO 4500 ungenutzt, acht Karten mit 16 Hälften bieten also 16 Decoder statt 24; das Profil 1g.16gb+me.all gibt einer Hälfte alle drei.

Videoanalyse und VDI auf acht oder vier Karten

Bei Videoanalyse zählen die Decoder. NVIDIA nennt drei NVENC- und drei NVDEC-Engines je RTX PRO 4500 Server Edition und je vier pro RTX PRO 6000 Server Edition, acht kleinere Karten tragen also 24 Decoder und vier größere 16. Die Streams je Decoder hängen von Codec, Auflösung und Bildrate ab und werden mit Ihren Kameras gemessen. Passen die Erkennungsmodelle in 32 GB, bietet der Server mit acht Karten mehr Decoder bei 1.320 W Leistungsaufnahme der Karten gegenüber bis zu 2.400 W.

Für VDI stehen beide Karten auf NVIDIAs Liste der von der vGPU-Software unterstützten GPUs, aktualisiert am 2. Oktober 2026: die RTX PRO 4500 Server Edition ab Release 20.0 und die RTX PRO 6000 Server Edition ab Release 19.0. Jedes vGPU-Profil hat eine feste Framebuffer-Größe, Karten mit 32 GB und mit 96 GB teilen sich also in unterschiedlich viele Desktops einer bestimmten Größe auf. vWS, vPC und vApps werden pro gleichzeitigem Nutzer lizenziert, die Zahl der Karten ändert diese Zählung also nicht.

Strom, Steckplätze und Gehäuse: der Lenovo SR650a V4 als Beispiel

NVIDIA spezifiziert die RTX PRO 4500 Server Edition als passive Single-Slot-Karte in voller Höhe und voller Länge mit 165 W und einer Anbindung über PCIe 5.0 x16. Die luftgekühlte RTX PRO 6000 Server Edition ist eine Dual-Slot-Karte, und NVIDIAs Product Brief SP-12355-001_v02 gibt ihr einen 600-W-Modus und einen 450-W-Modus, jeweils mit einem Minimum von 300 W. Vier Karten ziehen bei 600 W 2.400 W oder bei 450 W 1.800 W. Auf 300 W begrenzt ziehen sie 1.200 W, weniger als acht RTX PRO 4500, mit geringerem Durchsatz je Karte. NVIDIAs Produktseite nennt nicht, bei welcher Leistungseinstellung ihre FP4- und FP8-Werte gelten.

Lenovos 2U-Server ThinkSystem SR650a V4 ist für beide Karten gelistet. Sein Produktleitfaden, aktualisiert am 5. Oktober 2026, nennt „Unterstützung für bis zu 4 GPUs doppelter Breite oder 8 GPUs einfacher Breite, eingebaut in den vorderen Steckplätzen.“ Lenovos Leitfaden zur RTX PRO 6000 Server Edition schreibt, dass die Karte „auf 450 W leistungsbegrenzt konfiguriert werden kann, damit 4 GPUs im SR650a V4 installiert werden können“; die 600-W-Version ist dort auf zwei beschränkt. Lenovos Leitfaden zur RTX PRO 4500 Server Edition, aktualisiert am 28. Juli 2026, hält fest: „Der SR650a V4 unterstützt die GPU jetzt“. Das Maximum je Server konnten wir in diesem Leitfaden nicht lesen, acht Karten sind deshalb im Konfigurator des Herstellers zu bestätigen.

Jede der beiden GPU-Summen allein bleibt unter den rund 3,7 kW einer einphasigen 16-A-Zuleitung bei 230 V; Prozessoren, Arbeitsspeicher und Lüfter kommen hinzu, planen Sie die Zuleitung also für den ganzen Server. Ob ein Server oder zwei dieselben Karten besser einsetzen, behandelt unser Vergleich ein 8-GPU-Server oder zwei 4-GPU-Server.

NVIDIA AI Enterprise und vGPU-Lizenzen je GPU

NVIDIAs Lizenzleitfaden, aktualisiert am 2. September 2026, schreibt, dass NVIDIA AI Enterprise „pro GPU lizenziert wird“ und dass für einen Server oder eine Workstation mit seiner Software eine Lizenz „für jede GPU erforderlich ist, die im Server oder in der Workstation installiert ist“. Wo es eingesetzt wird, brauchen acht Karten also acht Lizenzen und vier Karten vier. Der Leitfaden nennt H100 PCIe und NVL, A800 40GB Active und H200 NVL als Karten mit enthaltenem Abonnement, keine der beiden RTX PRO Server Edition. Der Leitfaden erwähnt MIG nicht; wir zählen deshalb eine Lizenz je physischer Karte, wie auch immer sie aufgeteilt ist.

CUDA, vLLM und Triton laufen ohne die Lizenz, wie unser Leitfaden zur Lizenzierung von NVIDIA AI Enterprise erklärt; ein vLLM-Server auf Bare Metal braucht deshalb in keiner der beiden Konfigurationen eine.

Welche Konfiguration für welchen Workload

WORKLOADKONFIGURATIONBEGRÜNDUNG
Viele Modelle bis 20 GiB8 × RTX PRO 4500 SEacht Karten für Engines; ein Ausfall kostet 32 GB
Embeddings und Rerankerbeide, mit MIG16 Instanzen auf beiden Servern
14B-Modelle je Abteilung4 × RTX PRO 6000 SE mit MIGeine 24-GB-Instanz fasst ein 14B-Modell in FP8
Videoanalyse8 × RTX PRO 4500 SE24 Decoder bei 1.320 W Leistungs­aufnahme
VDI mit vWS oder vPCbeidebeide auf NVIDIAs vGPU-Liste; Profilgrößen Unter­scheiden sich
1 oder 2 Modelle, 70B-Klasse4 × RTX PRO 6000 SEeine Kopie je Karte, kein Verkehr zwischen Karten
Strom­begrenzte Rackpositionbeide, je nach Leistungs­begrenzung1.320 W, oder vier RTX PRO 6000 auf 300 W begrenzt mit 1.200 W

Unsere Lesart der Abschnitte oben; Quellen wie in den ersten beiden Tabellen.

Beschreiben Sie Ihre Modelle, Kamera-Streams oder Desktops und die Rackposition im Formular unten, und wir legen beide Konfigurationen nebeneinander aus.

Was wir liefern

Wir bauen KI-Server nach Auftrag mit acht Karten der RTX PRO 4500 Server Edition oder vier der RTX PRO 6000 Server Edition, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente und Lieferung in die ganze EU, unter einem EU-Vertrag und auf einer Rechnung. Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen, und liefern Konfiguration und Angebot innerhalb eines Werktages. Beide Karten gibt es auch allein aus unserem Sortiment professioneller GPUs, neben L40S, L4 und H200 NVL. Lizenzen für NVIDIA AI Enterprise und vGPU kommen auf dieselbe Rechnung, wo der Aufbau sie braucht.

FAQ

RTX PRO 4500 Server vs RTX PRO 6000 Server: was ist der Unterschied?
Die RTX PRO 4500 Server Edition hat 32 GB GDDR7 mit 800 GB/s und 10.496 CUDA-Kerne in einer passiven Single-Slot-Karte mit 165 W. Die RTX PRO 6000 Server Edition hat 96 GB mit 1.597 GB/s und 24.064 CUDA-Kerne in einer Dual-Slot-Karte, konfigurierbar von 300 bis 600 W. Beide unterstützen MIG und vGPU, und keine der beiden hat NVLink.
Viele kleine GPUs oder wenige große: was ist für Inferenz besser?
Viele kleinere Karten passen zu einem Server, der viele Modelle bis rund 20 GiB Gewichte, Embeddings und Video-Streams betreibt, weil jede Karte ein eigener Platz für eine Engine ist. Wenige große Karten passen zu 32B-Modellen in FP8 und zu Modellen der 70B-Klasse, die dann auf eine Karte passen und keinen Verkehr zwischen Karten brauchen. Entscheidend ist das größte Modell, das mit seinem Cache auf eine Karte passen muss.
Was läuft auf einem Server mit 8x RTX PRO 4500 Server Edition?
Nach unserer Schätzung hält jede Karte ein Modell bis rund 20 GiB Gewichte mit seinem Cache, zum Beispiel Qwen3-14B in FP8 mit rund 16 Gesprächen bei 8K, mit eingeschaltetem ECC 13. Qwen3-32B in FP8 braucht zwei Karten und Llama 3.3 70B in FP8 vier, über PCIe verteilt. Der Server bietet bis zu 16 MIG-Instanzen mit 16 GB und 24 Videodecoder.
Wie plane ich die GPU-Dichte für einen Inferenz-Server?
Beginnen Sie mit dem Speicher je Karte, weil das größte Modell auf eine Karte passen oder bei diesen Karten über PCIe verteilt werden muss. Zählen Sie dann getrennte Workloads, MIG-Instanzen, Video-Engines und Leistungsaufnahme: Acht RTX PRO 4500 Server Edition bieten 256 GB bei 1.320 W, vier RTX PRO 6000 Server Edition 384 GB bei bis zu 2.400 W. Bestätigen Sie zuletzt die Kartenzahl, die der Serverhersteller für das Gehäuse aufführt.
Wie viele NVIDIA-AI-Enterprise-Lizenzen braucht ein Server mit acht GPUs?
NVIDIA lizenziert AI Enterprise pro GPU, eine Lizenz für jede GPU in einem Server, auf dem die Software läuft, acht Karten brauchen also acht Lizenzen und vier Karten vier. Die Karten der RTX PRO Server Edition enthalten kein Abonnement; NVIDIAs Lizenzleitfaden nennt enthaltene Abonnements nur für H100 PCIe und NVL, A800 40GB Active und H200 NVL. vLLM oder Triton auf Bare Metal laufen ohne die Lizenz.
Welcher GPU-Server eignet sich für viele kleine Modelle?
Ein Server mit acht Karten der RTX PRO 4500 Server Edition bietet acht getrennte Karten mit 32 GB und bis zu 16 MIG-Instanzen bei 1.320 W Leistungsaufnahme. Vier Karten der RTX PRO 6000 Server Edition bieten dieselbe Zahl an MIG-Instanzen mit je 24 GB, genug für ein 14B-Modell in FP8 je Instanz. Entscheiden Sie nach der Größe des größten kleinen Modells und danach, wie viele Modelle eine eigene Karte brauchen.

Schicken Sie uns die geplanten Modelle mit ihrer Präzision, die Nutzer oder Kamera-Streams je Workload, die Desktops für vGPU und die Stromzuleitung an der Rackposition. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot für acht Karten der RTX PRO 4500 oder vier der RTX PRO 6000 Server Edition und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien