BLOG · GUIDE · AUGUST 2026

Nutanix und GPUs: Aufbau eines KI-Clusters

IN KÜRZE
  • Von fünfzehn NX-Modellen nehmen elf GPUs auf. Die Obergrenze pro Knoten: vier H100 oder L40S im NX-9151-G9
  • Der Buchstabe N im Modellcode sagt nichts über GPUs: Der NX-8155N-G8 nimmt drei Karten, der NX-8150N-G8 keine
  • Die L40S lässt sich mit MIG gar nicht teilen; die RTX PRO 6000 Server Edition teilt sich in vier 24-GB-Instanzen
  • MIG-gestützte vGPU ist für vSphere, Red Hat KVM und Ubuntu KVM gelistet — AHV wird nicht genannt
  • MIG aktivieren schaltet NVLink und P2P ab, und NCCL funktioniert damit nicht — verteiltes Training lässt sich auf Scheiben nicht aufbauen

Welche Knoten Karten aufnehmen — und welche nicht

Ein hyperkonvergenter Knoten ist ein Server, in dem Platten, Rechenleistung und Netzwerk unter AOS zu einem Block verschmolzen sind. Platz für eine Full-Size-Karte ist nicht immer da — Laufwerkskäfige und Lüfter fressen ihn. Deshalb nehmen manche NX-Modelle bis zu vier Beschleuniger auf und andere keinen.

KNOTENFORMFAKTORGPUs
NX-9151-G92U1Nbis 4× H100 oder L40S
NX-3155-G92U1Nbis 4× A2, L4, L40S oder H100
NX-8155-G92U1Nbis 3× A2, L4 oder L40S
NX-8155N-G82U1Nbis 3× A2 oder L4
NX-8155A-G92U1N2× A100 80 GB
NX-3035-G9, NX-1175S-G92U2N / 1U1Nbis 2× A2 oder L4
NX-1150S-G92U1N0 oder 1× L4 24 GB
NX-8150-G9, NX-8170-G9, NX-8150N-G8, NX-8170N-G81U1N / 2U1Nnicht unterstützt

Nach Nutanix-Knotenspezifikationen; die letzte Zeile sind Datenbank- und Storage-Knoten

Die GPU-Fähigkeit am Buchstabensuffix abzulesen funktioniert nicht — die Tabelle zeigt es direkt. Verlässlich sind zwei Prüfungen: die GPU-Zeile im Spec-Sheet des Modells und die für das Chassis validierte Kartenliste. NX-9151-G9 und NX-3155-G9 akzeptieren die H100; der NX-8155-G9 mit demselben 2U1N-Formfaktor endet bei der L40S. Strom und Airflow setzen das Limit, nicht die Gehäusegröße.

Was eine fünfte Karte blockiert

Die Leistungsspanne der Baureihe ist sechsfach: Ein NX-1150S-G9 erreicht in der Spitze 531 VA, während ein NX-9151-G9 mit vier Karten 3.232 VA verlangt und bis zu 11.021 BTU pro Stunde abgibt — ein eigenes Gespräch mit Ihrem Rechenzentrum über Phase und Reihenkühlung.

Der zweite Grund: Serverkarten sind passiv. L40S und RTX PRO 6000 Server Edition haben keine eigenen Lüfter und leben vom Front-to-Back-Airflow des Chassis. In NVIDIAs Forum steht ein bezeichnender Fall: eine L40S in einer Dell-Precision-Workstation, im Leerlauf bei 100 °C. Außerhalb eines Servers ist das nicht behebbar.

Drei Wege, eine Karte an eine VM zu geben

METHODEWIE GETEILT WIRDISOLATION & LIZENZ
Passthroughganze Karte an eine VMvollständig; keine vGPU-Lizenz nötig
Time-sliced vGPUZeitteilung, Prozesse wechseln sich abkeine Speicher-/Fehlerisolation; Lizenz Pflicht
MIG-gestützte vGPUparallel arbeitende Hardware-ScheibenHardware-Isolation, ~20% schneller als Time-Slicing

Dann kommt das Limit, an dem die Hälfte aller Multi-Karten-Pläne scheitert. Die MIG-Dokumentation sagt es klar: Mit aktiviertem MIG sind die NVLink-Links aus, die Karte verliert P2P, und NCCL ist nicht unterstützt. NVIDIAs Forums-Position: Verteiltes Training über MIG lässt sich theoretisch durch GPUDirect RDMA übers Netz drücken, ist aber langsamer, als eine größere Scheibe zu nehmen oder MIG abzuschalten. Eine Karte partitionieren und schneller Karte-zu-Karte-Austausch schließen einander aus.

Welche Karte sich wie weit teilt

KARTEMAX. MIG-INSTANZENKLEINSTE SCHEIBE
RTX PRO 6000 Blackwell SE, 96 GB41g.24gb — 24 GB, 46 SM
RTX PRO 4500 Blackwell, 32 GB21g.16gb — 16 GB
H100 PCIe, 80 GB71g.10gb — 10 GB
H200 NVL, 141 GB71g.18gb — 18 GB
L40S, L4, A2, A16kein MIGnur Passthrough oder Time-sliced vGPU

Die letzte Zeile verdient Aufmerksamkeit bei der Knotenwahl: Die L40S ist die Arbeitskarte für NX-9151-G9 und NX-3155-G9 — und genau sie lässt sich nicht schneiden. „Wie partitionieren wir dann die L40S?“ ist eine Frage, die in NVIDIAs Forum Leute stellen, die die Karte nach TFLOPS gewählt und das Partitionierungsmodell erst danach angeschaut haben.

Was auf AHV funktioniert

NVIDIA pflegt eine eigene Support-Seite für Nutanix AHV und stuft den Hypervisor als generisches Linux mit KVM ein. Gewöhnliches Time-sliced vGPU funktioniert. Aber in der konsolidierten Feature-Tabelle ist MIG-gestützte vGPU nur für vSphere, Red Hat KVM und Ubuntu KVM ab Release 19.0 angehakt. Prüfen Sie die Kompatibilität für Ihre AOS-Version vor der Bestellung.

Zwei weitere Dinge tauchen nach dem Deployment auf. Live-Migration einer vGPU-VM verlangt die identische physische Karte, Treiberversion und Hypervisor-Version auf dem Zielhost — und funktioniert nie zwischen verschiedenen MIG-Profilen. Und das Verhalten ohne Lizenz: 20 Minuten volle Geschwindigkeit, dann 1280×1024 bei drei Bildern pro Sekunde mit CUDA aus. C-Compute-Profile gibt es nur mit NVIDIA AI Enterprise (lizenziert pro GPU), Grafik-vWS pro gleichzeitigem Nutzer — zwei getrennte Budgetzeilen.

Wie viele VMs pro Karte

vGPU-TYPSPEICHER PRO VMVMs PRO KARTE
DC-96C96 GB1
DC-48C48 GB2
DC-24C24 GB4
DC-12C12 GB8
DC-8C8 GB12

Compute-Profile für die RTX PRO 6000 Blackwell Server Edition

Für Arbeitsplätze nennt NVIDIA für beide RTX-PRO-Karten dieselbe Dichte: zwei bis vier schwere Nutzer pro Karte, drei bis sechs mittlere, sechs bis acht leichte. Und der budgetschonende Vorbehalt: Der Best-Effort-Scheduler erlaubt oft eine 2–3-fache Überbuchung. Die Monitoring-Regel ist simpel — die Videospeicher-Füllung einer VM sollte selten über 90% gehen und im Schnitt unter 70% liegen.

GEMESSEN WURDEOHNE PARTITIONIERUNGMIT MIG
flan-t5-base auf A100 40 GB~3.400 Tok/s~9.800 Tok/s auf 7 Scheiben
Sprach-Pipeline auf A1000,74 Anfr./s1,00 (Time-Slicing: 0,76)
P95-Latenz neben lauten Nachbarn~2.499 ms~1.319 ms
Einzelaufgabe auf einer 1/7-Scheibe0,00533 s0,02640 s

Die letzte Zeile ist der Preis der Partitionierung: Eine einzelne Scheibe ist rund fünfmal langsamer als die ganze Karte. Der Gesamtdurchsatz wächst trotzdem, weil ein kleines Modell eine A100 nicht sättigt — und die Skalierung ist sublinear.

Wo anfangen und wie wachsen

Die funktionierende Startkonfiguration besteht aus drei Knoten: RF2-Replikation läuft auf dreien, und der Cluster übersteht den Verlust eines Knotens, ohne VMs zu stoppen. Karten braucht nicht jeder Knoten — das Muster, das am häufigsten funktioniert: drei Knoten für allgemeine Workloads, einer oder zwei davon mit Beschleunigern für Inferenz.

Halten Sie den GPU-Pool homogen — der Grund ist die Live-Migration. Ein zweiter Knoten mit derselben Karte gibt Reserve und einen Ort, wohin VMs während der Wartung ziehen. Ein gemischter Cluster mit einer L40S in einem Knoten und einer RTX PRO 6000 im anderen funktioniert auch — aber jede geplante Wartung wird zu einem Abend voller Service-Stopps.

Was wir liefern

Eurokommerz liefert die Nutanix-NX-Baureihe zusammen mit den dafür validierten GPUs — L40S, L4, H100 — plus die RTX PRO 6000 Server Edition und die H200 NVL, mit EU-Rechnung und Herstellergarantie. Deployment und Virtualisierungs-Engineering kommen von unserem Partner Vixen.UNO unter demselben Vertrag.

FAQ

Die L40S unterstützt kein MIG. Wie teilen wir sie?
Time-sliced vGPU. Das L40S-8Q-Profil gibt sechs Instanzen homogen, vier heterogen. Es gibt keine Hardware-Speicher- oder Fehlerisolation — die Karte wechselt zeitlich zwischen den VMs.
Brauchen wir AI Enterprise, um eine MIG-Instanz an eine VM zu geben?
Für C-Compute-Profile ja: Sie kommen nur mit AI Enterprise, lizenziert pro GPU im Server. MIG selbst auf blankem Linux braucht keine Lizenz — das Geld beginnt dort, wo eine Scheibe auf einen Hypervisor trifft.
Die Karte meldet 450 W statt 600. Ist sie defekt?
Meist ist es das Kabel: Die 12VHPWR-Sense-Konfiguration setzt das Power-Limit, und manche beigelegten Serverkabel sind auf 450 W konfiguriert. Das 600-W-Teil ist eine eigene SKU — in die Stückliste aufnehmen.
Was bringen zwei Karten im Knoten gegenüber einer?
Keinen gemeinsamen Speicherpool. Zwei 48-GB-Karten sind zwei unabhängige 48er. Der Wert: mehrere Modelle nebeneinander resident (Reranker, Embeddings, Haupt-LLM), oder doppelt so viele Nutzer.
Können wir L40S- und RTX-PRO-6000-Knoten in einem Cluster mischen?
Es funktioniert, aber Live-Migration verlangt identische Karten — jede geplante Wartung bedeutet also Service-Stopps auf dem Knoten ohne Gegenstück. Halten Sie den GPU-Pool homogen, wo es geht.

Nennen Sie uns die Modelle, die Sie betreiben, und die Zahl der Personen, die damit arbeiten — ein Ingenieur wählt Knoten und Kartenzahl, kalkuliert die Lizenzen und sagt, wo die Konfiguration ans Strom-Limit des Racks stößt. Wir antworten innerhalb eines Werktages.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten — siehe unsere Datenschutzerklärung.

request@eurokommerz.at  ·  +43 1 585 1405 50  ·  Jordangasse 7, 1010 Wien