Acht RTX PRO 6000 in einem Server: was ein KI-Server mit 8 GPUs für ein Unternehmen mit 1.000 Mitarbeitern betreibt
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Acht Karten der RTX PRO 6000 Server Edition bieten 768 GB GPU-Speicher als acht getrennte Pools mit je 96 GB: Die Karte hat kein NVLink und ist über PCIe 5.0 x16 angebunden, der Server wird deshalb Karte für Karte geplant
- In unserem Beispiel für 1.000 Mitarbeiter betreiben vier Karten gpt-oss-120b als je eine Kopie für Chat und RAG, eine betreibt ein Coding-Modell, eine wird per MIG in vier Instanzen mit 24 GB aufgeteilt, eine bedient ein Dokumentenmodell und eine bleibt in Reserve
- Mit den Beispielwerten unseres Sizing-Leitfadens ergeben 1.000 Mitarbeiter nach unserer Schätzung rund 40 Anfragen in Bearbeitung in der Spitze; vier Kopien von gpt-oss-120b halten 76 Gespräche bei 32K und 57, wenn eine Karte ausfällt
- NVIDIAs Referenzarchitektur RTX PRO AI Factory baut auf einem Knoten mit acht Karten auf, den sie 2-8-5-200 nennt: 2 CPUs, 8 GPUs und 5 NICs mit je 200 Gbit/s, mit mindestens 128 GB Systemspeicher je GPU
- Acht Karten mit bis zu 600 W ziehen 4,8 kW vor Prozessoren und Lüftern; bei 2.000 Mitarbeitern verdoppelt sich die Beispielspitze auf 80, und zwei Server mit je fünf Kopien des Assistenten halten sie, wenn einer ausfällt
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
Was acht RTX PRO 6000 in einem Server betreiben können
Ein 8x RTX PRO 6000 Server betreibt jedes LLM, das in 96 GB passt, als eine oder mehrere getrennte Kopien und größere Modelle über PCIe verteilt auf mehrere Karten. Seine acht Karten der RTX PRO 6000 Blackwell Server Edition haben 768 GB GPU-Speicher, aber als acht getrennte Pools mit je 96 GB, denn die Karte hat kein NVLink, und die Karten tauschen Daten nur über PCIe 5.0 x16 aus. Der Server wird deshalb Karte für Karte geplant: Jedes Modell, das auf eine Karte passt, bekommt eine oder mehrere eigene Karten, und nur ein Modell, das für 96 GB zu groß ist, wird auf mehrere verteilt.
Für ein Unternehmen mit 1.000 Mitarbeitern gibt unser Beispiel dem wichtigsten Chat- und RAG-Modell vier Karten, eine Kopie je Karte. Eine Karte betreibt ein Coding-Modell, eine wird per MIG in vier Instanzen mit 24 GB für Embeddings, Reranking, Spracherkennung und ein kleines Task-Modell aufgeteilt, eine bedient ein Vision-Language-Modell für Dokumente und Batch-Jobs, und eine bleibt als Reserve und Testumgebung frei. Die Nutzerzahlen wenden die Beispielwerte unseres Leitfadens zur Auslegung eines privaten ChatGPT-Servers nach Unternehmensgröße an, und die Speicherwerte sind unsere Schätzungen, keine Messungen. Ein Server allein bietet kein Failover bei einem Hostfehler; deshalb sieht derselbe Leitfaden ab 500 Mitarbeitern zwei Server vor, und der Abschnitt zu 2.000 Mitarbeitern behandelt den zweiten Server.
Der RTX PRO Server und NVIDIAs Knoten 2-8-5-200
NVIDIA hat RTX PRO Server, gebaut von seinen Systempartnern, am 11. August 2025 angekündigt, in Designs, die „zwei, vier oder acht NVIDIA RTX PRO 6000 Blackwell GPUs unterstützen können“, mit Konfigurationen aus acht Karten in 4U. Seine Referenzarchitektur RTX PRO AI Factory, zuletzt am 18. Mai 2026 aktualisiert, baut auf der Version mit acht Karten auf und nennt den Knoten eine „2-8-5-200-Infrastrukturkonfiguration (2 CPUs, 8 GPUs, 5 NICs mit je 200 Gbit/s)“. Die fünf Adapter sind eine BlueField-3 DPU für den Nord-Süd-Verkehr und vier BlueField-3 SuperNICs für den Verkehr zwischen Knoten. NVIDIA schreibt über das Design: „Unterstützt effizient Inferenz für kleine und mittlere Modellgrößen“, und nennt es „ideal für Mehrbenutzer-Workloads mit nur einem Mandanten“, was ein Unternehmen beschreibt, das seine eigenen Mitarbeiter bedient.
| MERKMAL | JE KARTE | ACHT-KARTEN-SERVER |
|---|---|---|
| GPU-Speicher | 96 GB GDDR7 mit ECC | 768 GB in acht Pools |
| Speicherbandbreite | 1.597 GB/s | 1.597 GB/s je Pool |
| Maximale Leistung | bis zu 600 W, konfigurierbar | bis zu 4,8 kW GPU-Leistung |
| MIG | bis zu 4 Instanzen mit 24 GB | bis zu 32 Instanzen |
| Host-Anbindung | PCIe 5.0 x16, kein NVLink | mindestens ein Gen5-x16-Link je GPU |
| Systemspeicher | je Server festgelegt | mindestens 128 GB je GPU, 1 TB |
| Netzwerk | je Server festgelegt | 1 BlueField-3 DPU, 4 SuperNICs |
Produktseite und Datenblatt der NVIDIA RTX PRO 6000 Blackwell Server Edition; Lenovo-Produktleitfaden LP2263 (aktualisiert am 28. Juli 2026) für NVLink und Host-Schnittstelle; Referenzarchitektur NVIDIA RTX PRO AI Factory (18. Mai 2026) für Links, Systemspeicher und Netzwerk; abgerufen am 10. Oktober 2026.
Beispielaufteilung für ein Unternehmen mit 1.000 Mitarbeitern
Unser Sizing-Leitfaden arbeitet mit vier Beispielwerten: 40 Prozent der Mitarbeiter in der Spitzenstunde aktiv, 6 Anfragen je Nutzer und Stunde, 30 Sekunden je Anfrage und ein Spitzenfaktor von 2. Der Leitfaden rechnet sie für 500 und 2.000 Mitarbeiter durch. Auf 1.000 angewandt ergeben sie nach unserer Schätzung 400 Nutzer in der Spitzenstunde, 2.400 Anfragen pro Stunde, im Mittel rund 20 Anfragen in Bearbeitung und 40 in der Beispielspitze. Für gpt-oss-120b bei deklarierten 32K Kontext und einem 16-Bit-KV-Cache schätzt derselbe Leitfaden 19 Gespräche je RTX PRO 6000, aus 22,2 GiB Cache neben 60,8 GiB Gewichten.
| KARTE | WORKLOAD | BEISPIELMODELL | BELEGTER SPEICHER |
|---|---|---|---|
| Karten 1 bis 4 | Chat- und RAG-Assistent, eine Kopie je Karte | gpt-oss-120b | 60,8 GiB Gewichte, 22,2 GiB Cache, 19 Gespräche bei 32K je Karte |
| Karte 5 | Coding-Assistent und Agenten | Qwen3-Coder-30B-A3B, FP8 | 31,2 GB Gewichte; 9 Sitzungen mit 64K, rund 19 mit FP8-Cache |
| Karte 6, MIG 4 × 1g.24gb | Embeddings, Reranking, Spracherkennung, Task-Modell | Qwen3-0,6B-Modellpaar, Whisper large-v3, gpt-oss-20b | 1,2 GB, 1,2 GB, rund 10 GB und 13,8 GB, ein Modell je Instanz |
| Karte 7 | Dokumentenmodell tagsüber, Batch-Jobs nachts | Qwen3.8-27B, FP8 | 30,9 GB Gewichte, 25 Gespräche bei 32K |
| Karte 8 | Reserve und Testumgebung | neue Modellversionen, Engine-Upgrades | leer, oder eine fünfte Kopie von gpt-oss-120b |
Beispielaufteilung, keine Messung. Die Speicherwerte sind unsere Schätzungen aus unseren Leitfäden zur Auslegung privater ChatGPT-Server, zu Coding-Assistenten, Qwen, Embeddings und Spracherkennung: 0,9 × die 95,6 GiB, die der Treiber meldet, abzüglich 3 GiB je Karte (der Coding-Leitfaden behält die 3 GiB bei); die 10 GB für Whisper sind OpenAIs Angabe; MIG-Profil aus NVIDIAs MIG-Benutzerhandbuch (11. September 2026).
Vier Kopien des Assistenten halten 76 Gespräche bei 32K gegenüber der Beispielspitze von 40, und 57, wenn eine Karte ausfällt oder wegen eines Treiberproblems herausgenommen wird. Ein Load Balancer verteilt die Anfragen auf die vier Kopien. Das Coding-Modell hat eine eigene Karte, weil Agenten bei jedem Schritt Prompts mit Zehntausenden Token senden und dieser Cache auf einer geteilten Karte mit den Gesprächen des Assistenten konkurrieren würde. Qwen3.8-27B liest gescannte Seiten und Bilder; Karte 7 beantwortet deshalb tagsüber Fragen zu Dokumenten und arbeitet nachts eingereihte Extraktionsjobs ab, etwa für Rechnungen oder Verträge.
Auf Karte 8 lässt sich eine neue Modellversion oder ein neues vLLM-Release auf der Produktionshardware ausprobieren, bevor es eine laufende Kopie ersetzt. Wächst die Spitze, wird Karte 8 zur fünften Kopie des Assistenten, und fünf Kopien halten 95 Gespräche. Wie mehrere Engines gestartet, an Karten gebunden und unter einem Endpunkt bereitgestellt werden, behandelt unser Leitfaden zum Betrieb mehrerer Modelle auf einem GPU-Server.
Wir bauen Server mit bis zu acht Karten der RTX PRO 6000 Server Edition, ausgelegt nach den Modellen und den gleichzeitigen Nutzern. Nennen Sie uns Ihre Anwendungsfälle und die Zahl der Mitarbeiter, und wir schlagen eine Konfiguration mit der Aufteilung der Karten vor.
Welche Abteilung welche Karten nutzt
Für diejenigen, die den Plan genehmigen, liest sich derselbe Plan anders. Abteilungsleiter wollen wissen, welche Karten ihren Workload tragen und wodurch dieser Anteil wächst.
| ABTEILUNG, NUTZUNG | KARTEN | BEISPIELMODELL | BESTIMMT DEN ANTEIL |
|---|---|---|---|
| Belegschaft, Assistent, RAG | 1 bis 4, Retrieval auf 6 | gpt-oss-120b | Anfragen in Bearbeitung in der Spitze |
| Softwareentwicklung | 5 | Qwen3-Coder-30B-A3B | Promptlänge der Agentenschritte |
| Service Desk, Meetings | eine MIG-Instanz auf 6 | Whisper large-v3 | Live-Streams, Stunden an Audio |
| Finanzen, Einkauf, Recht | 7 | Qwen3.8-27B | Seiten pro Tag, Batch-Fenster |
| IT- und KI-Team | 8 | Kandidaten im Test | zu validierende Releases |
Beispielabteilungen und Beispielmodelle; die Anteile folgen der Aufteilungstabelle oben. Modellwerte aus unseren Sizing-Leitfäden, abgerufen am 10. Oktober 2026.
Liegt der Workload jeder Abteilung auf eigenen Karten, hat das eine zweite Wirkung. Verdoppelt sich der Bedarf der Entwickler, werden aus Karte 5 zwei Karten, und die Kopien des Assistenten bleiben, wie sie sind. Eine Abteilung, die später dazukommt, zum Beispiel ein Übersetzungsdienst, nimmt zuerst die Reservekarte und zieht auf einen zweiten Server um, sobald die Reserve wieder für Failover gebraucht wird.
MIG auf der geteilten Karte
NVIDIAs MIG-Benutzerhandbuch, aktualisiert am 11. September 2026, bietet auf der RTX PRO 6000 drei Größen: 1g.24gb bis zu viermal, 2g.48gb bis zu zweimal und 4g.96gb einmal. Jede Instanz hat ihren eigenen Speicher und ihre eigene Fehlerisolierung, ein Fehler in der Engine für Spracherkennung hält das Embedding-Modell also nicht an. Eine gewöhnliche 1g.24gb-Instanz hat einen Videodecoder und einen Encoder, und die Variante 1g.24gb-me lässt für reine Rechenarbeit alle Media-Engines weg. Zwischen 24 und 48 GB gibt es keine Größe, ein Modell mit 30 GB belegt also eine 2g.48gb-Instanz.
MIG passt zu den kleinen Modellen einer RAG-Pipeline und zum Task-Modell, das Chat-Titel und Tags schreibt. Für gpt-oss-120b, dessen 60,8 GiB die ganze Karte brauchen, bringt es nichts. Die Server Edition verlässt das Werk im Display-off-Modus und braucht vor MIG deshalb keine Umstellung des Anzeigemodus. Auf Hopper und späteren GPUs, Blackwell eingeschlossen, überstehen der MIG-Modus und seine Instanzen weder einen Neustart noch ein Neuladen des Treibers und müssen beim Start neu angelegt werden, wie unsere Anleitung zur MIG-Einrichtung auf RTX PRO Blackwell Schritt für Schritt zeigt.
PCIe-Topologie, Systemspeicher und Strom
Die Referenzarchitektur ordnet die Karten so an, dass „8 GPUs gleichmäßig über CPU-Sockel und Root-Ports verteilt sind“, mit mindestens einem Gen5-x16-Link je GPU und PCIe-Switches nur dort, wo sie nötig sind. Im Beispiel passt jedes Modell auf eine Karte, während der Server Anfragen bedient, wandern also keine Daten zwischen den Karten. Die Topologie zählt, sobald ein Modell aufgeteilt wird, etwa ein Modell über 96 GB mit Tensor-Parallelismus. Seine Karten gehören dann auf den kürzesten Pfad, den nvidia-smi topo -m anzeigt. Wo die GPUs eines Knotens kein NVLink haben, rät die Dokumentation von vLLM zu Pipeline-Parallelismus statt Tensor-Parallelismus, „für höheren Durchsatz und geringeren Kommunikationsaufwand“, und unser Artikel zu einem Modell auf mehreren GPUs über PCIe und NVLink behandelt den Verkehr, den jede Methode erzeugt.
Dasselbe Dokument verlangt mindestens 128 GB Systemspeicher und 7 physische CPU-Kerne je GPU, für acht Karten also 1 TB und 56 Kerne, sowie für Inferenzserver mindestens ein NVMe-Laufwerk mit 1 TB je CPU-Sockel. NVIDIAs Konfigurationsleitfaden für NVIDIA-Certified Systems setzt beim Systemspeicher eine höhere Untergrenze, das Doppelte des gesamten GPU-Speichers, für acht Karten also 1.536 GB. Modell-Checkpoints, der RAG-Index und Logs kommen zu diesem Minimum hinzu. Binden Sie jede Engine an den Prozessorsockel, an dem ihre Karte hängt; auch das zeigt die Topologieausgabe.
NVIDIA gibt die maximale Leistung der Karte mit „bis zu 600 W (konfigurierbar)“ an. Acht Karten ziehen 4,8 kW vor Prozessoren, Arbeitsspeicher und Lüftern, was an der Rackposition Drehstromzuleitungen oder mehrere einphasige Stromkreise verlangt. Lenovos Produktleitfaden dokumentiert eine Begrenzung auf 450 W „zur Unterstützung einer höheren Dichte“, mit der Lenovo vier Karten in seinem SR650a V4 unterbringt; bei 450 W ziehen acht Karten 3,6 kW. Prüfen Sie die Vorgaben des Serverherstellers, bevor Sie eine begrenzte Konfiguration planen.
Was sich bei 2.000 Mitarbeitern ändert
Mit denselben Beispielwerten ergeben 2.000 Mitarbeiter 800 Nutzer in der Spitzenstunde und 80 Anfragen in Bearbeitung in der Spitze. Unser Sizing-Leitfaden setzt auf jeden von zwei Servern fünf Kopien von gpt-oss-120b auf RTX PRO 6000; zusammen halten sie 190 Gespräche und 95, wenn ein Server ausfällt. Auf zwei Servern mit acht Karten betreiben die Karten 1 bis 5 den Assistenten, Karte 6 das Coding-Modell, Karte 7 die MIG-Instanzen und Karte 8 das Dokumentenmodell. Jeder Server betreibt alle Modelle, der zweite Server übernimmt also die Reserverolle, die Karte 8 bei 1.000 Mitarbeitern hatte.
Bei 1.000 Mitarbeitern bleibt ein Server ein Single Point of Failure für einen Hostfehler, ein Firmware-Update oder eine Treiberänderung, auch mit einer Ersatzkarte im Gehäuse. Aus diesem Grund sieht unser Sizing-Leitfaden ab 500 Mitarbeitern zwei Server vor. Ein Unternehmen, das den Assistenten während eines Wartungsfensters nicht anhalten kann, plant den zweiten Server von Anfang an ein, entweder einen zweiten Server mit acht Karten oder zwei Server mit vier Karten, wie unser Vergleich ein 8-GPU-Server oder zwei 4-GPU-Server zeigt.
Wir liefern KI-Server mit 2 bis 8 GPUs je Knoten, eine Anfrage kann also beide Varianten abdecken. Beschreiben Sie im Formular unten Ihre Kopfzahl, Ihre Standorte und Ihre Wartungsfenster, und wir schlagen für jede Variante eine Konfiguration vor.
Was wir liefern
Wir bauen KI-Server nach Auftrag mit bis zu acht Karten der RTX PRO 6000 Server Edition, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente und Lieferung in die ganze EU, unter einem EU-Vertrag und auf einer Rechnung. Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen, und liefern Konfiguration und Angebot innerhalb eines Werktages. Die Karten gibt es auch allein aus unserem Sortiment professioneller GPUs, neben H200 NVL, L40S und L4, und Lizenzen für NVIDIA AI Enterprise kommen auf dieselbe Rechnung, wo der Aufbau sie braucht. Modelle, RAG und die Plattform darüber sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.
FAQ
Was läuft auf einem Server mit 8x RTX PRO 6000?
Arbeiten acht RTX PRO 6000 wie eine GPU mit 768 GB?
Wie viele Nutzer bedient ein 8-GPU-Server mit RTX PRO 6000?
Wie viel Strom braucht ein Server mit acht RTX PRO 6000?
Kann MIG die Karten eines 8-GPU-Servers mit RTX PRO 6000 aufteilen?
Wann braucht ein Unternehmen einen zweiten 8-GPU-Server?
Schicken Sie uns Ihre Kopfzahl, die Anwendungsfälle je Abteilung, die Modelle, die Sie in Betracht ziehen, und die Stromzuleitung an der Rackposition. Wir antworten innerhalb eines Werktages mit einer Konfiguration samt Aufteilung der Karten und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages