BLOG · GUIDE ·

Acht RTX PRO 6000 in einem Server: was ein KI-Server mit 8 GPUs für ein Unternehmen mit 1.000 Mitarbeitern betreibt

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Acht Karten der RTX PRO 6000 Server Edition bieten 768 GB GPU-Speicher als acht getrennte Pools mit je 96 GB: Die Karte hat kein NVLink und ist über PCIe 5.0 x16 angebunden, der Server wird deshalb Karte für Karte geplant
  • In unserem Beispiel für 1.000 Mitarbeiter betreiben vier Karten gpt-oss-120b als je eine Kopie für Chat und RAG, eine betreibt ein Coding-Modell, eine wird per MIG in vier Instanzen mit 24 GB aufgeteilt, eine bedient ein Dokumentenmodell und eine bleibt in Reserve
  • Mit den Beispielwerten unseres Sizing-Leitfadens ergeben 1.000 Mitarbeiter nach unserer Schätzung rund 40 Anfragen in Bearbeitung in der Spitze; vier Kopien von gpt-oss-120b halten 76 Gespräche bei 32K und 57, wenn eine Karte ausfällt
  • NVIDIAs Referenzarchitektur RTX PRO AI Factory baut auf einem Knoten mit acht Karten auf, den sie 2-8-5-200 nennt: 2 CPUs, 8 GPUs und 5 NICs mit je 200 Gbit/s, mit mindestens 128 GB Systemspeicher je GPU
  • Acht Karten mit bis zu 600 W ziehen 4,8 kW vor Prozessoren und Lüftern; bei 2.000 Mitarbeitern verdoppelt sich die Beispielspitze auf 80, und zwei Server mit je fünf Kopien des Assistenten halten sie, wenn einer ausfällt

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Was acht RTX PRO 6000 in einem Server betreiben können

Ein 8x RTX PRO 6000 Server betreibt jedes LLM, das in 96 GB passt, als eine oder mehrere getrennte Kopien und größere Modelle über PCIe verteilt auf mehrere Karten. Seine acht Karten der RTX PRO 6000 Blackwell Server Edition haben 768 GB GPU-Speicher, aber als acht getrennte Pools mit je 96 GB, denn die Karte hat kein NVLink, und die Karten tauschen Daten nur über PCIe 5.0 x16 aus. Der Server wird deshalb Karte für Karte geplant: Jedes Modell, das auf eine Karte passt, bekommt eine oder mehrere eigene Karten, und nur ein Modell, das für 96 GB zu groß ist, wird auf mehrere verteilt.

Für ein Unternehmen mit 1.000 Mitarbeitern gibt unser Beispiel dem wichtigsten Chat- und RAG-Modell vier Karten, eine Kopie je Karte. Eine Karte betreibt ein Coding-Modell, eine wird per MIG in vier Instanzen mit 24 GB für Embeddings, Reranking, Spracherkennung und ein kleines Task-Modell aufgeteilt, eine bedient ein Vision-Language-Modell für Dokumente und Batch-Jobs, und eine bleibt als Reserve und Testumgebung frei. Die Nutzerzahlen wenden die Beispielwerte unseres Leitfadens zur Auslegung eines privaten ChatGPT-Servers nach Unternehmensgröße an, und die Speicherwerte sind unsere Schätzungen, keine Messungen. Ein Server allein bietet kein Failover bei einem Hostfehler; deshalb sieht derselbe Leitfaden ab 500 Mitarbeitern zwei Server vor, und der Abschnitt zu 2.000 Mitarbeitern behandelt den zweiten Server.

Der RTX PRO Server und NVIDIAs Knoten 2-8-5-200

NVIDIA hat RTX PRO Server, gebaut von seinen Systempartnern, am 11. August 2025 angekündigt, in Designs, die „zwei, vier oder acht NVIDIA RTX PRO 6000 Blackwell GPUs unterstützen können“, mit Konfigurationen aus acht Karten in 4U. Seine Referenzarchitektur RTX PRO AI Factory, zuletzt am 18. Mai 2026 aktualisiert, baut auf der Version mit acht Karten auf und nennt den Knoten eine „2-8-5-200-Infrastrukturkonfiguration (2 CPUs, 8 GPUs, 5 NICs mit je 200 Gbit/s)“. Die fünf Adapter sind eine BlueField-3 DPU für den Nord-Süd-Verkehr und vier BlueField-3 SuperNICs für den Verkehr zwischen Knoten. NVIDIA schreibt über das Design: „Unterstützt effizient Inferenz für kleine und mittlere Modellgrößen“, und nennt es „ideal für Mehrbenutzer-Workloads mit nur einem Mandanten“, was ein Unternehmen beschreibt, das seine eigenen Mitarbeiter bedient.

MERKMALJE KARTEACHT-KARTEN-SERVER
GPU-Speicher96 GB GDDR7 mit ECC768 GB in acht Pools
Speicher­bandbreite1.597 GB/s1.597 GB/s je Pool
Maximale Leistungbis zu 600 W, konfigurierbarbis zu 4,8 kW GPU-Leistung
MIGbis zu 4 Instanzen mit 24 GBbis zu 32 Instanzen
Host-AnbindungPCIe 5.0 x16, kein NVLinkmindestens ein Gen5-x16-Link je GPU
System­speicherje Server festgelegtmindestens 128 GB je GPU, 1 TB
Netzwerkje Server festgelegt1 BlueField-3 DPU, 4 SuperNICs

Produktseite und Datenblatt der NVIDIA RTX PRO 6000 Blackwell Server Edition; Lenovo-Produktleitfaden LP2263 (aktualisiert am 28. Juli 2026) für NVLink und Host-Schnittstelle; Referenzarchitektur NVIDIA RTX PRO AI Factory (18. Mai 2026) für Links, Systemspeicher und Netzwerk; abgerufen am 10. Oktober 2026.

Beispielaufteilung für ein Unternehmen mit 1.000 Mitarbeitern

Unser Sizing-Leitfaden arbeitet mit vier Beispielwerten: 40 Prozent der Mitarbeiter in der Spitzenstunde aktiv, 6 Anfragen je Nutzer und Stunde, 30 Sekunden je Anfrage und ein Spitzenfaktor von 2. Der Leitfaden rechnet sie für 500 und 2.000 Mitarbeiter durch. Auf 1.000 angewandt ergeben sie nach unserer Schätzung 400 Nutzer in der Spitzenstunde, 2.400 Anfragen pro Stunde, im Mittel rund 20 Anfragen in Bearbeitung und 40 in der Beispielspitze. Für gpt-oss-120b bei deklarierten 32K Kontext und einem 16-Bit-KV-Cache schätzt derselbe Leitfaden 19 Gespräche je RTX PRO 6000, aus 22,2 GiB Cache neben 60,8 GiB Gewichten.

KARTEWORKLOADBEISPIELMODELLBELEGTER SPEICHER
Karten 1 bis 4Chat- und RAG-Assistent, eine Kopie je Kartegpt-oss-120b60,8 GiB Gewichte, 22,2 GiB Cache, 19 Gespräche bei 32K je Karte
Karte 5Coding-Assistent und AgentenQwen3-Coder-30B-A3B, FP831,2 GB Gewichte; 9 Sitzungen mit 64K, rund 19 mit FP8-Cache
Karte 6, MIG 4 × 1g.24gbEmbeddings, Reranking, Sprach­erkennung, Task-ModellQwen3-0,6B-Modellpaar, Whisper large-v3, gpt-oss-20b1,2 GB, 1,2 GB, rund 10 GB und 13,8 GB, ein Modell je Instanz
Karte 7Dokumenten­modell tagsüber, Batch-Jobs nachtsQwen3.8-27B, FP830,9 GB Gewichte, 25 Gespräche bei 32K
Karte 8Reserve und Testumgebungneue Modell­versionen, Engine-Upgradesleer, oder eine fünfte Kopie von gpt-oss-120b

Beispielaufteilung, keine Messung. Die Speicherwerte sind unsere Schätzungen aus unseren Leitfäden zur Auslegung privater ChatGPT-Server, zu Coding-Assistenten, Qwen, Embeddings und Spracherkennung: 0,9 × die 95,6 GiB, die der Treiber meldet, abzüglich 3 GiB je Karte (der Coding-Leitfaden behält die 3 GiB bei); die 10 GB für Whisper sind OpenAIs Angabe; MIG-Profil aus NVIDIAs MIG-Benutzerhandbuch (11. September 2026).

Vier Kopien des Assistenten halten 76 Gespräche bei 32K gegenüber der Beispielspitze von 40, und 57, wenn eine Karte ausfällt oder wegen eines Treiberproblems herausgenommen wird. Ein Load Balancer verteilt die Anfragen auf die vier Kopien. Das Coding-Modell hat eine eigene Karte, weil Agenten bei jedem Schritt Prompts mit Zehntausenden Token senden und dieser Cache auf einer geteilten Karte mit den Gesprächen des Assistenten konkurrieren würde. Qwen3.8-27B liest gescannte Seiten und Bilder; Karte 7 beantwortet deshalb tagsüber Fragen zu Dokumenten und arbeitet nachts eingereihte Extraktionsjobs ab, etwa für Rechnungen oder Verträge.

Auf Karte 8 lässt sich eine neue Modellversion oder ein neues vLLM-Release auf der Produktionshardware ausprobieren, bevor es eine laufende Kopie ersetzt. Wächst die Spitze, wird Karte 8 zur fünften Kopie des Assistenten, und fünf Kopien halten 95 Gespräche. Wie mehrere Engines gestartet, an Karten gebunden und unter einem Endpunkt bereitgestellt werden, behandelt unser Leitfaden zum Betrieb mehrerer Modelle auf einem GPU-Server.

Wir bauen Server mit bis zu acht Karten der RTX PRO 6000 Server Edition, ausgelegt nach den Modellen und den gleichzeitigen Nutzern. Nennen Sie uns Ihre Anwendungsfälle und die Zahl der Mitarbeiter, und wir schlagen eine Konfiguration mit der Aufteilung der Karten vor.

Welche Abteilung welche Karten nutzt

Für diejenigen, die den Plan genehmigen, liest sich derselbe Plan anders. Abteilungsleiter wollen wissen, welche Karten ihren Workload tragen und wodurch dieser Anteil wächst.

ABTEILUNG, NUTZUNGKARTENBEISPIELMODELLBESTIMMT DEN ANTEIL
Belegschaft, Assistent, RAG1 bis 4, Retrieval auf 6gpt-oss-120bAnfragen in Bearbeitung in der Spitze
Software­entwicklung5Qwen3-Coder-30B-A3BPromptlänge der Agenten­schritte
Service Desk, Meetingseine MIG-Instanz auf 6Whisper large-v3Live-Streams, Stunden an Audio
Finanzen, Einkauf, Recht7Qwen3.8-27BSeiten pro Tag, Batch-Fenster
IT- und KI-Team8Kandidaten im Testzu validierende Releases

Beispielabteilungen und Beispielmodelle; die Anteile folgen der Aufteilungstabelle oben. Modellwerte aus unseren Sizing-Leitfäden, abgerufen am 10. Oktober 2026.

Liegt der Workload jeder Abteilung auf eigenen Karten, hat das eine zweite Wirkung. Verdoppelt sich der Bedarf der Entwickler, werden aus Karte 5 zwei Karten, und die Kopien des Assistenten bleiben, wie sie sind. Eine Abteilung, die später dazukommt, zum Beispiel ein Übersetzungsdienst, nimmt zuerst die Reservekarte und zieht auf einen zweiten Server um, sobald die Reserve wieder für Failover gebraucht wird.

MIG auf der geteilten Karte

NVIDIAs MIG-Benutzerhandbuch, aktualisiert am 11. September 2026, bietet auf der RTX PRO 6000 drei Größen: 1g.24gb bis zu viermal, 2g.48gb bis zu zweimal und 4g.96gb einmal. Jede Instanz hat ihren eigenen Speicher und ihre eigene Fehlerisolierung, ein Fehler in der Engine für Spracherkennung hält das Embedding-Modell also nicht an. Eine gewöhnliche 1g.24gb-Instanz hat einen Videodecoder und einen Encoder, und die Variante 1g.24gb-me lässt für reine Rechenarbeit alle Media-Engines weg. Zwischen 24 und 48 GB gibt es keine Größe, ein Modell mit 30 GB belegt also eine 2g.48gb-Instanz.

MIG passt zu den kleinen Modellen einer RAG-Pipeline und zum Task-Modell, das Chat-Titel und Tags schreibt. Für gpt-oss-120b, dessen 60,8 GiB die ganze Karte brauchen, bringt es nichts. Die Server Edition verlässt das Werk im Display-off-Modus und braucht vor MIG deshalb keine Umstellung des Anzeigemodus. Auf Hopper und späteren GPUs, Blackwell eingeschlossen, überstehen der MIG-Modus und seine Instanzen weder einen Neustart noch ein Neuladen des Treibers und müssen beim Start neu angelegt werden, wie unsere Anleitung zur MIG-Einrichtung auf RTX PRO Blackwell Schritt für Schritt zeigt.

PCIe-Topologie, Systemspeicher und Strom

Die Referenzarchitektur ordnet die Karten so an, dass „8 GPUs gleichmäßig über CPU-Sockel und Root-Ports verteilt sind“, mit mindestens einem Gen5-x16-Link je GPU und PCIe-Switches nur dort, wo sie nötig sind. Im Beispiel passt jedes Modell auf eine Karte, während der Server Anfragen bedient, wandern also keine Daten zwischen den Karten. Die Topologie zählt, sobald ein Modell aufgeteilt wird, etwa ein Modell über 96 GB mit Tensor-Parallelismus. Seine Karten gehören dann auf den kürzesten Pfad, den nvidia-smi topo -m anzeigt. Wo die GPUs eines Knotens kein NVLink haben, rät die Dokumentation von vLLM zu Pipeline-Parallelismus statt Tensor-Parallelismus, „für höheren Durchsatz und geringeren Kommunikationsaufwand“, und unser Artikel zu einem Modell auf mehreren GPUs über PCIe und NVLink behandelt den Verkehr, den jede Methode erzeugt.

Dasselbe Dokument verlangt mindestens 128 GB Systemspeicher und 7 physische CPU-Kerne je GPU, für acht Karten also 1 TB und 56 Kerne, sowie für Inferenzserver mindestens ein NVMe-Laufwerk mit 1 TB je CPU-Sockel. NVIDIAs Konfigurationsleitfaden für NVIDIA-Certified Systems setzt beim Systemspeicher eine höhere Untergrenze, das Doppelte des gesamten GPU-Speichers, für acht Karten also 1.536 GB. Modell-Checkpoints, der RAG-Index und Logs kommen zu diesem Minimum hinzu. Binden Sie jede Engine an den Prozessorsockel, an dem ihre Karte hängt; auch das zeigt die Topologieausgabe.

NVIDIA gibt die maximale Leistung der Karte mit „bis zu 600 W (konfigurierbar)“ an. Acht Karten ziehen 4,8 kW vor Prozessoren, Arbeitsspeicher und Lüftern, was an der Rackposition Drehstromzuleitungen oder mehrere einphasige Stromkreise verlangt. Lenovos Produktleitfaden dokumentiert eine Begrenzung auf 450 W „zur Unterstützung einer höheren Dichte“, mit der Lenovo vier Karten in seinem SR650a V4 unterbringt; bei 450 W ziehen acht Karten 3,6 kW. Prüfen Sie die Vorgaben des Serverherstellers, bevor Sie eine begrenzte Konfiguration planen.

Was sich bei 2.000 Mitarbeitern ändert

Mit denselben Beispielwerten ergeben 2.000 Mitarbeiter 800 Nutzer in der Spitzenstunde und 80 Anfragen in Bearbeitung in der Spitze. Unser Sizing-Leitfaden setzt auf jeden von zwei Servern fünf Kopien von gpt-oss-120b auf RTX PRO 6000; zusammen halten sie 190 Gespräche und 95, wenn ein Server ausfällt. Auf zwei Servern mit acht Karten betreiben die Karten 1 bis 5 den Assistenten, Karte 6 das Coding-Modell, Karte 7 die MIG-Instanzen und Karte 8 das Dokumentenmodell. Jeder Server betreibt alle Modelle, der zweite Server übernimmt also die Reserverolle, die Karte 8 bei 1.000 Mitarbeitern hatte.

Bei 1.000 Mitarbeitern bleibt ein Server ein Single Point of Failure für einen Hostfehler, ein Firmware-Update oder eine Treiberänderung, auch mit einer Ersatzkarte im Gehäuse. Aus diesem Grund sieht unser Sizing-Leitfaden ab 500 Mitarbeitern zwei Server vor. Ein Unternehmen, das den Assistenten während eines Wartungsfensters nicht anhalten kann, plant den zweiten Server von Anfang an ein, entweder einen zweiten Server mit acht Karten oder zwei Server mit vier Karten, wie unser Vergleich ein 8-GPU-Server oder zwei 4-GPU-Server zeigt.

Wir liefern KI-Server mit 2 bis 8 GPUs je Knoten, eine Anfrage kann also beide Varianten abdecken. Beschreiben Sie im Formular unten Ihre Kopfzahl, Ihre Standorte und Ihre Wartungsfenster, und wir schlagen für jede Variante eine Konfiguration vor.

Was wir liefern

Wir bauen KI-Server nach Auftrag mit bis zu acht Karten der RTX PRO 6000 Server Edition, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente und Lieferung in die ganze EU, unter einem EU-Vertrag und auf einer Rechnung. Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen, und liefern Konfiguration und Angebot innerhalb eines Werktages. Die Karten gibt es auch allein aus unserem Sortiment professioneller GPUs, neben H200 NVL, L40S und L4, und Lizenzen für NVIDIA AI Enterprise kommen auf dieselbe Rechnung, wo der Aufbau sie braucht. Modelle, RAG und die Plattform darüber sind unsere Leistung Private AI/ML, mit Engineering von unserem Engineering-Partner Vixen.UNO.

FAQ

Was läuft auf einem Server mit 8x RTX PRO 6000?
Er betreibt jedes Modell, das auf eine Karte mit 96 GB passt, als eine oder mehrere Kopien, und größere Modelle über PCIe auf mehrere Karten verteilt, solange Gewichte und Cache zusammen in die acht Karten passen, nach unserer Auslegungsregel rund 664 GiB. In unserem Beispiel für 1.000 Mitarbeiter betreiben vier Karten gpt-oss-120b für Chat und RAG, und je eine Karte dient einem Coding-Modell, MIG-Instanzen für Retrieval und Spracherkennung, einem Dokumentenmodell und als Reserve. NVIDIAs Referenzarchitektur beschreibt den Knoten mit acht Karten als geeignet für Inferenz bei kleinen und mittleren Modellgrößen.
Arbeiten acht RTX PRO 6000 wie eine GPU mit 768 GB?
Nein. Jede Karte behält ihre eigenen 96 GB, und die RTX PRO 6000 hat kein NVLink; Karten, die sich ein Modell teilen, tauschen Daten deshalb über PCIe 5.0 x16 aus. Modelle, die auf eine Karte passen, laufen daher als getrennte Kopien, eine je Karte, ohne Verkehr zwischen den Karten.
Wie viele Nutzer bedient ein 8-GPU-Server mit RTX PRO 6000?
Das hängt von den Anfragen in Bearbeitung in der Spitze ab, nicht von der Kopfzahl. Mit den Beispielwerten unseres Sizing-Leitfadens ergeben 1.000 Mitarbeiter rund 40 Anfragen in Bearbeitung, und vier Karten mit gpt-oss-120b halten 76 Gespräche bei deklarierten 32K Kontext, beides nach unserer Schätzung. Die anderen vier Karten bleiben für Coding, Retrieval, Dokumente und eine Reserve.
Wie viel Strom braucht ein Server mit acht RTX PRO 6000?
NVIDIA gibt für jede Karte ein Maximum von bis zu 600 W an, konfigurierbar; acht Karten ziehen also 4,8 kW vor Prozessoren, Arbeitsspeicher und Lüftern. Lenovo dokumentiert eine Begrenzung auf 450 W für höhere Dichte, mit der die Karten auf 3,6 kW kommen. Planen Sie vor der Bestellung Drehstromzuleitungen oder mehrere Stromkreise an der Rackposition ein.
Kann MIG die Karten eines 8-GPU-Servers mit RTX PRO 6000 aufteilen?
Ja. NVIDIAs MIG-Benutzerhandbuch nennt je RTX PRO 6000 bis zu vier Instanzen 1g.24gb, zwei 2g.48gb oder eine 4g.96gb, jede mit eigenem Speicher und eigener Fehlerisolierung. MIG passt zu Embedding-Modellen, Rerankern, Spracherkennung und kleinen Task-Modellen, während ein Modell wie gpt-oss-120b eine ganze Karte braucht.
Wann braucht ein Unternehmen einen zweiten 8-GPU-Server?
Ein zweiter Server ist nötig, wenn der Dienst einen Hostausfall oder ein Wartungsfenster überstehen muss und wenn die Spitze über einen Server hinauswächst. Mit unseren Beispielwerten ergeben 2.000 Mitarbeiter 80 Anfragen in Bearbeitung, und zwei Server mit je fünf Kopien von gpt-oss-120b halten noch 95 Gespräche, wenn einer ausfällt. Zwei Server mit vier Karten sind eine Alternative, wo ein Server je Standort oder eine kleinere Ausfalldomäne das Ziel ist.

Schicken Sie uns Ihre Kopfzahl, die Anwendungsfälle je Abteilung, die Modelle, die Sie in Betracht ziehen, und die Stromzuleitung an der Rackposition. Wir antworten innerhalb eines Werktages mit einer Konfiguration samt Aufteilung der Karten und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien