BLOG · GUIDE ·

Vier RTX PRO 6000 Max-Q in einer Workstation: 384 GB unter dem Schreibtisch und was es dafür braucht

IN KÜRZE
  • NVIDIA hat die Max-Q-Edition für dicht bestückte Workstations gebaut: die vollen 96 GB und 1.792 GB/s bei 300 W, „bis zu vier GPUs in einem einzigen System“, 384 GB insgesamt
  • Zu den Towern mit vier Max-Q-Karten in ihren offiziellen Spezifikationen gehören die HP Z8 Fury G6i, die Lenovo ThinkStation PX und die Dell Precision 7960; Dells Pro Precision 9 T6 nimmt fünf auf. In den Spezifikationen dieser Hersteller endet die Workstation Edition mit 600 W bei einer oder zwei pro Tower
  • Vier Karten mit x16 brauchen 64 PCIe-5.0-Lanes: Threadripper PRO 9000 WX und die größeren Modelle des Xeon 600 bieten 128, der Xeon W-3500 bietet 112
  • Vier Karten und ein Prozessor mit 350 W kommen ohne Arbeitsspeicher, Laufwerke und Lüfter auf etwa 1,55 kW; planen Sie mit 1,8 bis 2 kW an der Steckdose, die vollständig als Wärme im Raum landen
  • Es gibt kein NVLink, große Modelle werden also über PCIe verteilt; MIG macht aus den vier Karten bis zu sechzehn isolierte Instanzen zu 24 GB für ein Team

Wozu es die Max-Q gibt

Die RTX PRO 6000 Blackwell gibt es in drei Editionen mit denselben 24.064 CUDA-Kernen und 96 GB GDDR7, wie unser Editionsvergleich erklärt. Die Workstation Edition läuft mit 600 W und einem Double-Flow-Through-Kühler, die Server Edition ist passiv gekühlt und für Rack-Gehäuse gedacht, und die Max-Q behält den vollen Speicher und die vollen 1.792 GB/s bei 300 W. NVIDIAs Produktseite nennt den Zweck unumwunden: „Sie ermöglicht bis zu vier GPUs in einem einzigen System“, mit „bis zu 384 GB kombiniertem Speicher in einer Konfiguration mit vier GPUs“.

Was die geringere Leistungsaufnahme kostet, ist Takt: 2.280 MHz Boost statt 2.617, 110 TFLOPS FP32 statt 125, 3.511 AI TOPS statt 4.000. Puget Systems hat die Max-Q in Blender 5 bis 13 Prozent hinter der Workstation Edition gemessen und in DaVinci Resolve und Unreal Engine etwa 14 Prozent dahinter. NVIDIA beschreibt den Kühler nur als „aktiv“; Puget beschreibt ihn als Radialgebläse, das Luft aus dem Inneren des Gehäuses ansaugt und durch die Rückseite hinausdrückt, und genau das erlaubt es, vier Karten nebeneinander zu setzen. Eine Karte mit Double-Flow-Through-Kühler gibt ihre Wärme dagegen ins Gehäuse ab, was bei ihrer Leistungsaufnahme von 600 W der wahrscheinlichste Grund dafür ist, dass die Hersteller in der Tabelle unten nur eine oder zwei pro Maschine listen.

Welche Tower vier aufnehmen

TOWERPROZESSORMAX-Q-KARTEN600-W-KARTENNETZTEIL
HP Z8 Fury G6iIntel Xeon 600, bis zu 86 Kerne4nicht gelistet1.700 W bei 200 V oder mehr; zwei Netzteile bis zu 2.700 W zusammen
Lenovo ThinkStation PXzwei Intel-Xeon-Scalable-Prozessoren4nicht gelistet1.850 W; bis zu 2.350 W mit zwei Netzteilen im Team-Modus
Dell Precision 7960Intel Xeon W-3400 oder W-35004nicht angegeben1.400 W oder 2.200 W; das 2.200-W-Netzteil liefert seine volle Nennleistung bei 180 bis 264 V
Dell Pro Precision 9 T6Intel Xeon 600522.400 W bei 200 bis 240 V
Lenovo ThinkStation P8AMD Threadripper PRO 9000 oder 7000 WX311.000 oder 1.400 W

Produktseiten, Konfiguratoren und Spezifikationsdokumente der Hersteller, September 2026; die Angabe zur Eingangsspannung der Pro Precision 9 T6 aus dem Launch-Bericht von StorageReview. HPs Vorgängermodell Z8 Fury G5 nahm ebenfalls vier Max-Q-Karten oder eine Workstation Edition auf.

Zwei Dinge fallen auf. Die Tower, die vier Max-Q-Karten aufnehmen, listen keine vier 600-W-Karten: Das Maximum, das einer dieser Hersteller listet, sind zwei, in Dells Pro Precision 9 T6. Und jedes dieser Netzteile liefert seine volle Nennleistung an einer europäischen 230-V-Steckdose, während die niedrigeren Werte in den Tabellen der Hersteller für Netze mit 100 bis 127 V gelten.

Nach dem Leistungsbudget unten kann das 1.400-W-Netzteil von Dell vier Karten unter Volllast nicht versorgen, und ein einzelnes HP-Netzteil liefe an seiner Grenze; eine Bestellung mit vier Karten sollte deshalb das größere Netzteil oder die Ausführung mit zwei Netzteilen nennen.

Lanes: der Prozessor entscheidet

Vier Karten mit voller Breite brauchen 64 PCIe-Lanes, bevor die NVMe-Laufwerke und die Netzwerkkarte ihre eigenen belegen. AMDs Prozessoren Threadripper PRO 9000 WX bieten 128 PCIe-5.0-Lanes, Intels Xeon 600 für Workstations bei den größeren Modellen wie dem 658X und dem 698X ebenfalls 128 und die Serie Xeon W-3500 112. Alle bedienen vier Karten mit x16.

Die Verdrahtung der Steckplätze zählt ebenso viel wie der Prozessor. StorageReview hat zwei Max-Q-Karten in HPs Z8 Fury G6i getestet, die jeden GPU-Steckplatz mit PCIe 5.0 x16 anbindet, und in einer Dell Precision 7875 auf Threadripper-Basis, in der die zweite Karte mit PCIe 4.0 x16 lief. Beim Serving von Llama 3.1 8B in FP8 mit vLLM bei einer Batchgröße von 256 erreichte die HP 23.004 Token pro Sekunde und die Dell 16.833; der Test schreibt das sowohl den Steckplätzen als auch dem Umgang des Prozessors mit dem Scheduling von vLLM zu. Lesen Sie die Steckplatztabelle eines Towers vor seiner Prozessorliste.

Strom: ein 2-kW-Gerät

Vier Karten zu je 300 W ergeben 1.200 W. Ein Prozessor mit 350 W, der Nennleistung sowohl eines Threadripper PRO 9995WX als auch eines Xeon 698X, dessen Turbo-Grenze bei 420 W liegt, bringt die Summe auf 1.550 W, noch ohne Arbeitsspeicher, Laufwerke, Lüfter und die Verluste im Netzteil. An der Steckdose sind das unter Volllast grob 1,8 bis 2 kW. Das ist unsere Schätzung aus den Nennwerten: Einen unabhängigen Test eines Towers mit vier Max-Q und gemessener Leistungsaufnahme an der Steckdose haben wir nicht gefunden.

An einem 230-V-Stromkreis entsprechen 2 kW etwa 9 A. Ein 16-A-Stromkreis mit 3.680 W versorgt die Maschine mit reichlich Spielraum, aber nicht zwei davon zusammen mit dem Rest eines Büros. Dimensionieren Sie eine USV mit Reserve über 2 kW, und stellen Sie sicher, dass der Stromkreis im Gebäude nicht schon eine Küche oder einen Druckerraum mitversorgt.

Wärme und Lautstärke

Praktisch die gesamte aufgenommene Leistung landet als Wärme im Raum: 2 kW entsprechen etwa 6.800 BTU pro Stunde, so viel wie ein 2-kW-Heizlüfter, der den ganzen Tag läuft. Ein kleines Büro ohne Klimaanlage erwärmt sich spürbar, und mit ihm steigt die Ansaugtemperatur der Maschine selbst. Planen Sie den Raum ebenso wie das Gerät.

Eine unabhängige Lautstärkemessung eines Max-Q-Towers mit vier Karten haben wir ebenfalls nicht gefunden. Fordern Sie die Akustikdaten des konfigurierten Systems an, bevor es neben einem Arbeitsplatz aufgestellt wird, und richten Sie die Rückseite der Maschine, an der die Radialgebläse ausblasen, zum freien Raum aus.

Was auf 384 GB läuft

MODELLPRÄZISIONGEWICHTEBENÖTIGTE KARTEN
gpt-oss-120bMXFP460,8 GiBeine je Instanz: vier unabhängige Server
Llama 3.3 70BFP868 GiBeine, mit FP8-Cache für etwa vierzehn 8k-Gespräche; zwei für mehr
Qwen3-235B-A22BNVFP4134 GBzwei
Qwen3-235B-A22BFP8236 GBvier
GLM-4.5FP8361 GBvier nur auf dem Papier: etwa 46 GiB bleiben für Laufzeitumgebung und Cache, unter dem Minimum der Model Card von acht H100 oder vier H200
Llama 3.1 405BFP8etwa 487 GBpasst nicht
DeepSeek-V3 oder R1FP8etwa 689 GBpasst nicht

Gewichte aus den Model Cards und veröffentlichten Checkpoints auf Hugging Face, in GB oder GiB wie veröffentlicht; jede Karte fasst 95,6 GiB (etwa 102,6 GB), wie der Treiber sie meldet. Der Wert für Llama 3.1 405B in FP8 ist unsere Summe aus den Parametertypen des Checkpoints. Die eigenen Serving-Beispiele der Model Card von Qwen3-235B in FP8 nutzen vier GPUs; einen veröffentlichten Benchmark davon auf vier RTX-PRO-6000-Karten haben wir nicht gefunden.

Die sinnvollen Konfigurationen sind die ersten vier Zeilen: ein großes Mixture-of-Experts-Modell über alle vier Karten, zwei oder vier kleinere Modelle nebeneinander oder ein 70B-Modell mit Platz für ein Team. Veröffentlichte Zahlen mit mehreren Karten stammen von StorageReview, das vier Karten der RTX PRO 6000 Server Edition mit etwa 11 Prozent weniger Bandbreite als die Max-Q betrieb und vLLM das Modell über alle vier verteilen ließ: gpt-oss-120b in NVFP4 erreichte 105,8 Token pro Sekunde je Nutzer bei vier Nutzern, und Llama 2 70B erreichte 32,9 Token pro Sekunde für einen einzelnen Nutzer.

Ein Modell über PCIe verteilen

Die RTX PRO 6000 hat kein NVLink, ein über mehrere Karten verteiltes Modell tauscht seine Daten also über PCIe aus. vLLMs Dokumentation empfiehlt Tensor-Parallelismus, wenn ein Modell zu groß für eine GPU ist, aber in einen Knoten passt, und ergänzt in einem Hinweis zu ungleichmäßigen GPU-Aufteilungen: „Wenn die GPUs im Knoten keine NVLINK-Verbindung haben (z. B. L40S), nutzen Sie Pipeline-Parallelismus statt Tensor-Parallelismus, für höheren Durchsatz und geringeren Kommunikationsaufwand“. Testen Sie beides mit Ihrem eigenen Modell.

Direkte Transfers zwischen den Karten helfen. Google meldet bis zu 168 Prozent mehr Durchsatz beim tensor-parallelen Serving auf Maschinen mit RTX PRO 6000 Server Edition und einem PCIe-Peer-to-Peer-Datenpfad, verglichen mit Instanzen ohne einen solchen. NVIDIAs NCCL-Dokumentation erklärt einen Grund, warum solche Transfers scheitern: Auf Bare-Metal-Linux „unterstützen CUDA und der NVIDIA-Treiberstack keine PCIe-Peer-to-Peer-Speicherübertragung mit aktivierter IOMMU“. Prüfen Sie die IOMMU- und ACS-Einstellungen im BIOS, bevor Sie den Karten die Schuld geben.

Sechzehn Instanzen für ein Team: MIG

Jede Max-Q teilt sich in bis zu vier isolierte Instanzen zu 24 GB, der Tower kann einem Entwicklerteam also sechzehn unabhängige GPUs anbieten. MIG läuft unter Linux mit Treiber 575.51.03 oder neuer und einem Max-Q-vBIOS 98.02.6A.00.00 oder neuer, und jede Karte muss zuerst mit NVIDIAs DisplayModeSelector vom Grafik- in den Compute-Modus umgeschaltet werden. Auf einer Karte, die den Monitor ansteuert, schaltet diese Umstellung die Displayausgänge ab; eine MIG-Workstation läuft also entweder headless oder behält eine kleine separate Karte für den Bildschirm. Profile mit dem Suffix „+gfx“ erhalten die Grafikunterstützung innerhalb einer Instanz. vGPU für virtuelle Maschinen gibt es auf der Max-Q nicht; das ist eine Funktion der Server Edition, wie unser Leitfaden zu MIG und vGPU erklärt.

Tower oder Server

Vier Karten der Server Edition in einem Rackserver bieten dieselben 384 GB mit passiver Kühlung, einer konfigurierbaren Leistungsgrenze von bis zu 600 W und vGPU-Unterstützung, ohne die Probleme im Büro, brauchen aber einen Serverraum mit seinem Luftstrom und seinem Lärm. Unser Artikel dazu, wie viele GPUs in einen Server passen, behandelt diese Seite. Der Tower ist die richtige Antwort für ein Team ohne Serverraum; der Server ist die richtige Antwort, sobald die Maschine über Abteilungen hinweg geteilt wird oder rund um die Uhr für Kunden läuft.

Was wir liefern

Eurokommerz liefert die RTX PRO 6000 Blackwell Max-Q EU-weit mit Herstellergarantie, als Einzelkarten oder in einer konfigurierten Workstation oder einem Server mit vier Karten, wobei Netzteil, Plattform und Kühlung auf die Last ausgelegt sind. Schicken Sie uns die Modelle und die Zahl der Nutzer, und wir antworten mit der Konfiguration und ihrem Leistungsbudget.

FAQ

Passen vier Karten der RTX PRO 6000 Workstation Edition in einen Tower?
Die Spezifikationen der Hersteller listen höchstens eine Workstation Edition mit 600 W pro Tower in HPs Vorgängermodell Z8 Fury G5 und der Lenovo ThinkStation P8 und zwei in Dells Pro Precision 9 T6. Vier Karten in einem Tower sind das, wofür die Max-Q mit 300 W gedacht ist.
Wie viel Leistung braucht eine Max-Q-Workstation mit vier Karten?
Etwa 1.550 W für vier Karten und einen Prozessor mit 350 W und nach unserer Schätzung grob 1,8 bis 2 kW an der Steckdose unter Volllast. Ein Stromkreis mit 230 V und 16 A versorgt sie.
Arbeiten vier Karten wie eine GPU mit 384 GB?
Nein. Die RTX PRO 6000 hat kein NVLink, deshalb verteilt die Software ein großes Modell per Tensor- oder Pipeline-Parallelismus über PCIe auf die Karten.
Welchen Prozessor braucht eine Workstation mit vier GPUs?
Einen mit mindestens 64 PCIe-Lanes für die Karten plus den Rest des Systems: Threadripper PRO 9000 WX und die größeren Modelle des Xeon 600 bieten 128 PCIe-5.0-Lanes, der Xeon W-3500 bietet 112. Prüfen Sie, ob jeder GPU-Steckplatz mit x16 angebunden ist.
Können sich mehrere Personen die Workstation teilen?
Ja, mit MIG: Jede Max-Q teilt sich in bis zu vier isolierte Instanzen zu 24 GB, sechzehn insgesamt, unter Linux mit Treiber 575.51.03 oder neuer, einem aktuellen vBIOS und auf Compute gestelltem Anzeigemodus.
Wie viel langsamer ist eine Max-Q als eine Workstation Edition?
Puget Systems hat in Tests zur Content-Erstellung 5 bis 14 Prozent weniger Leistung gemessen. Speichergröße und Bandbreite sind gleich: 96 GB und 1.792 GB/s.

Nennen Sie uns die Modelle, die Sie betreiben wollen, wie viele Personen die Maschine nutzen werden und wo sie stehen wird. Wir legen Karten, Plattform und Stromversorgung aus und sagen Ihnen, ob ein Tower oder ein Server besser passt. Wir antworten innerhalb eines Werktages.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at  ·  +43 1 585 1405 50  ·  Jordangasse 7, 1010 Wien