BLOG · GUIDE · AUGUST 2026

Nutanix und GPUs: Aufbau eines KI-Clusters

IN KÜRZE
  • Sechs NX-Plattformen nehmen heute GPUs auf, verteilt auf die Generationen G9 und G10. Die Obergrenze pro Knoten: vier L40S oder H100 NVL im NX-9151-G9
  • Der Modellcode verrät es nicht: Der NX-8150G-G10 nimmt drei Karten, der NX-8155-G9 im selben 2U1N-Chassis steht gar nicht auf der GPU-Liste von Nutanix
  • Die L40S lässt sich mit MIG gar nicht teilen; die RTX PRO 6000 Server Edition teilt sich in vier 24-GB-Instanzen
  • MIG-gestützte vGPU ist für vSphere, Red Hat KVM und Ubuntu KVM gelistet – AHV wird nicht genannt
  • MIG-Instanzen können nicht per Peer-to-Peer über GPUs hinweg kommunizieren, und NCCL funktioniert mit MIG nicht – verteiltes Training lässt sich auf Scheiben nicht aufbauen

Welche Knoten Karten aufnehmen – und welche nicht

Ein hyperkonvergenter Knoten ist ein Server, in dem Platten, Rechenleistung und Netzwerk unter AOS zu einem Block verschmolzen sind. Platz für eine Full-Size-Karte ist nicht immer da – Laufwerkskäfige und Lüfter fressen ihn. Deshalb nehmen manche NX-Modelle bis zu vier Beschleuniger auf und andere keinen.

KNOTENFORMFAKTORGPUs
NX-9151-G92U1Nbis 4× L40S oder H100 NVL 94 GB
NX-3155-G92U1Nbis 2× L40S oder bis 4× L4
NX-8150G-G102U1Nbis 3× L4, A16 oder L40S
NX-8155AS-G102U1Nbis 3× L4 oder A16
NX-1175S-G101U1Nbis 2× L4
NX-1150S-G92U1NGPU-Option für den Edge (L4)
NX-8170, NX-3060, NX-3035, NX-8155, NX-8155A, NX-8173AS, NX-1120AS1U1N / 2U1N / 2U2N / 2U4Nnicht auf der GPU-Liste

Nach der Plattform-FAQ von Nutanix und dem G10-Launch-Material (G10-Knoten werden seit Oktober 2025 ausgeliefert); prüfen Sie vor der Bestellung das Spec-Sheet der exakten Generation

Die GPU-Fähigkeit am Modellcode abzulesen funktioniert nicht – die Tabelle zeigt es direkt. Verlässlich sind zwei Prüfungen: die GPU-Zeile im Spec-Sheet des Modells und die für das Chassis validierte Kartenliste. Der NX-9151-G9 akzeptiert die H100 NVL; der NX-3155-G9 mit demselben 2U1N-Formfaktor endet bei zwei L40S; die H100 80 GB PCIe ist qualifiziert, wird von Nutanix aber nicht verkauft. Strom und Airflow setzen das Limit, nicht die Gehäusegröße.

Was eine fünfte Karte blockiert

Die Leistungsspanne der Baureihe ist groß: Ein Edge-Knoten zieht ein paar hundert Watt, während ein NX-9151-G9 mit vier 350-W-Karten ein Leistungsbudget von mehreren kVA und ein passendes Kühlbudget braucht – ein eigenes Gespräch mit Ihrem Rechenzentrum über Phase und Reihenkühlung.

Der zweite Grund: Serverkarten sind passiv. L40S und RTX PRO 6000 Server Edition haben keine eigenen Lüfter und leben vom Front-to-Back-Airflow des Chassis. In NVIDIAs Forum steht ein bezeichnender Fall: eine L40S in einer Dell-Precision-Workstation, im Leerlauf bei 100 °C. Außerhalb eines Servers ist das nicht behebbar.

Drei Wege, eine Karte an eine VM zu geben

METHODEWIE GETEILT WIRDISOLATION & LIZENZ
Passthroughganze Karte an eine VMvollständig; keine vGPU-Lizenz nötig
Time-sliced vGPUZeitteilung, Prozesse wechseln sich abeigener Framebuffer pro VM, geteilte Rechenleistung, keine Fehlerisolation; Lizenz Pflicht
MIG-gestützte vGPUparallel arbeitende Hardware-ScheibenHardware-Isolation; NVIDIAs Sizing-Guide maß bei der 48-GB-Profilgröße 20% mehr Leistung als mit Time-Slicing

Dann kommt das Limit, an dem die Hälfte aller Multi-Karten-Pläne scheitert. Die MIG-Dokumentation sagt es klar: Mit aktiviertem MIG gibt es kein Peer-to-Peer zwischen Instanzen auf verschiedenen GPUs, weder über PCIe noch über NVLink, und NCCL ist nicht unterstützt. NVIDIAs Forums-Position: Verteiltes Training über MIG lässt sich theoretisch durch GPUDirect RDMA übers Netz drücken, ist aber langsamer, als eine größere Scheibe zu nehmen oder MIG abzuschalten. Eine Karte partitionieren und schneller Karte-zu-Karte-Austausch schließen einander aus.

Welche Karte sich wie weit teilt

KARTEMAX. MIG-INSTANZENKLEINSTE SCHEIBE
RTX PRO 6000 Blackwell SE, 96 GB41g.24gb – 24 GB, 46 SM
RTX PRO 4500 Blackwell, 32 GB21g.16gb – 16 GB
H100 NVL, 94 GB (die H100, die Nutanix verkauft)71g.12gb – 12 GB
H200 NVL, 141 GB71g.18gb – 18 GB
L40S, L4, A2, A16kein MIGnur Passthrough oder Time-sliced vGPU

Die letzte Zeile verdient Aufmerksamkeit bei der Knotenwahl: Die L40S ist die Arbeitskarte für NX-9151-G9 und NX-3155-G9 – und genau sie lässt sich nicht schneiden. „Wie partitionieren wir dann die L40S?“ ist eine Frage, die in NVIDIAs Forum Leute stellen, die die Karte nach TFLOPS gewählt und das Partitionierungsmodell erst danach angeschaut haben.

Was auf AHV funktioniert

NVIDIA pflegt eine eigene Support-Seite für Nutanix AHV und stuft den Hypervisor als generisches Linux mit KVM ein. Gewöhnliches Time-sliced vGPU funktioniert. Aber in der konsolidierten Feature-Tabelle ist MIG-gestützte vGPU nur für vSphere, Red Hat KVM und Ubuntu KVM ab Release 19.0 angehakt. Prüfen Sie die Kompatibilität für Ihre AOS-Version vor der Bestellung.

Zwei weitere Dinge tauchen nach dem Deployment auf. Live-Migration einer vGPU-VM verlangt die identische physische Karte auf dem Zielhost und einen Treiber aus demselben Release-Zweig in derselben oder einer neueren Version – und funktioniert nie zwischen verschiedenen MIG-Profilen. Und das Verhalten ohne Lizenz: 20 Minuten volle Geschwindigkeit, dann eine Begrenzung auf 15 fps mit eingeschränktem CUDA; nach 24 Stunden 3 fps und kein CUDA. C-Compute-Profile gibt es nur mit NVIDIA AI Enterprise (lizenziert pro GPU), Grafik-vWS pro gleichzeitigem Nutzer – zwei getrennte Budgetzeilen.

Wie viele VMs pro Karte

vGPU-TYPSPEICHER PRO VMVMs PRO KARTE
DC-96C96 GB1
DC-48C48 GB2
DC-24C24 GB4
DC-12C12 GB8
DC-8C8 GB12

Compute-Profile für die RTX PRO 6000 Blackwell Server Edition

Für virtuelle Desktops nennt NVIDIAs Sizing-Guide zwei bis vier schwere Nutzer pro RTX PRO 6000 (Profile DC-12Q bis DC-24Q) und sechs bis acht leichte Nutzer pro RTX PRO 4500 Server Edition (DC-4Q). Und der budgetschonende Vorbehalt: Der Best-Effort-Scheduler erlaubt oft eine 2–3-fach höhere Nutzerdichte. Die Monitoring-Regel ist simpel – die Videospeicher-Füllung einer VM sollte selten über 90% gehen und im Schnitt unter 70% liegen.

GEMESSEN WURDEOHNE PARTITIONIERUNGMIT MIG
flan-t5-base auf A100 40 GB (Red Hat)~4.200 Tok/s~9.800 Tok/s auf 7 Scheiben
P95-Latenz neben lauten Nachbarn~2.499 ms~1.319 ms (vLLM, Community-Test)
Kleine Einzelaufgabe auf 1/7-Scheibe0,00533 s0,02640 s (NVIDIA-Forum)

Die letzte Zeile ist der Preis der Partitionierung: Eine einzelne Scheibe ist rund fünfmal langsamer als die ganze Karte. Der Gesamtdurchsatz wächst trotzdem, weil ein kleines Modell eine A100 nicht sättigt – und die Skalierung ist sublinear.

Wo anfangen und wie wachsen

Die funktionierende Startkonfiguration besteht aus drei Knoten: RF2-Replikation läuft auf dreien, und der Cluster übersteht den Verlust eines Knotens, ohne VMs zu stoppen. Karten braucht nicht jeder Knoten – das Muster, das am häufigsten funktioniert: drei Knoten für allgemeine Workloads, einer oder zwei davon mit Beschleunigern für Inferenz.

Halten Sie den GPU-Pool homogen – der Grund ist die Live-Migration. Ein zweiter Knoten mit derselben Karte gibt Reserve und einen Ort, wohin VMs während der Wartung ziehen. Ein gemischter Cluster mit einer L40S in einem Knoten und einer RTX PRO 6000 im anderen funktioniert auch – aber jede geplante Wartung wird zu einem Abend voller Service-Stopps.

Was wir liefern

Eurokommerz liefert die Nutanix-NX-Baureihe zusammen mit den GPUs, die Nutanix dafür listet – L40S, L4, A16 und H100 NVL – sowie die RTX PRO 6000 Server Edition auf den neuesten Knoten, mit EU-Rechnung und Herstellergarantie. Deployment und Virtualisierungs-Engineering kommen von unserem Partner Vixen.UNO unter demselben Vertrag.

FAQ

Welche Nutanix-NX-Knoten unterstützen GPUs?
Sechs Plattformen aus den Generationen G9 und G10: NX-9151-G9 (bis zu vier L40S oder H100 NVL), NX-3155-G9 (bis zu zwei L40S oder vier L4), NX-8150G-G10 (bis zu drei L4, A16 oder L40S), NX-8155AS-G10 (bis zu drei L4 oder A16), NX-1175S-G10 (bis zu zwei L4) und der Edge-Knoten NX-1150S-G9.
Wie viele GPUs passen in einen NX-3155-G9?
Bis zu zwei L40S oder bis zu vier L4, in einem 2U-Gehäuse mit einem Knoten; die H100 80 GB ist qualifiziert, wird von Nutanix aber nicht verkauft. Strom und Luftstrom setzen die Grenze, nicht das Gehäuse.
Unterstützt der NX-8155-G9 die H100?
Nein. Der NX-8155-G9 steht gar nicht auf der GPU-Liste von Nutanix; sein GPU-Pendant ist der NX-8150G-G10 mit bis zu drei L4, A16 oder L40S. Die H100 NVL bleibt dem NX-9151-G9 vorbehalten.
Die L40S unterstützt kein MIG. Wie teilen wir sie?
Time-sliced vGPU. Das L40S-8Q-Profil gibt sechs Instanzen homogen, vier heterogen. Es gibt keine Hardware-Speicher- oder Fehlerisolation – die Karte wechselt zeitlich zwischen den VMs.
Brauchen wir AI Enterprise, um eine MIG-Instanz an eine VM zu geben?
Für C-Compute-Profile ja: Sie kommen nur mit AI Enterprise, lizenziert pro GPU im Server. MIG selbst auf blankem Linux braucht keine Lizenz – das Geld beginnt dort, wo eine Scheibe auf einen Hypervisor trifft.
Die Karte meldet 450 W statt 600. Ist sie defekt?
Meist ist es das Kabel: Die 12V-2×6-Sense-Konfiguration setzt das Power-Limit, und manche beigelegten Serverkabel sind auf 450 W konfiguriert. Das 600-W-Teil ist eine eigene SKU – in die Stückliste aufnehmen.
Was bringen zwei Karten im Knoten gegenüber einer?
Keinen gemeinsamen Speicherpool. Zwei 48-GB-Karten sind zwei unabhängige 48er. Der Wert: mehrere Modelle nebeneinander resident (Reranker, Embeddings, Haupt-LLM), oder doppelt so viele Nutzer.
Können wir L40S- und RTX-PRO-6000-Knoten in einem Cluster mischen?
Es funktioniert, aber Live-Migration verlangt identische Karten – jede geplante Wartung bedeutet also Service-Stopps auf dem Knoten ohne Gegenstück. Halten Sie den GPU-Pool homogen, wo es geht.

Nennen Sie uns die Modelle, die Sie betreiben, und die Zahl der Personen, die damit arbeiten – ein Ingenieur wählt Knoten und Kartenzahl, kalkuliert die Lizenzen und sagt, wo die Konfiguration ans Strom-Limit des Racks stößt. Wir antworten innerhalb eines Werktages.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at  ·  +43 1 585 1405 50  ·  Jordangasse 7, 1010 Wien