Nutanix und GPUs: Aufbau eines KI-Clusters
- Sechs NX-Plattformen nehmen heute GPUs auf, verteilt auf die Generationen G9 und G10. Die Obergrenze pro Knoten: vier L40S oder H100 NVL im NX-9151-G9
- Der Modellcode verrät es nicht: Der NX-8150G-G10 nimmt drei Karten, der NX-8155-G9 im selben 2U1N-Chassis steht gar nicht auf der GPU-Liste von Nutanix
- Die L40S lässt sich mit MIG gar nicht teilen; die RTX PRO 6000 Server Edition teilt sich in vier 24-GB-Instanzen
- MIG-gestützte vGPU ist für vSphere, Red Hat KVM und Ubuntu KVM gelistet – AHV wird nicht genannt
- MIG-Instanzen können nicht per Peer-to-Peer über GPUs hinweg kommunizieren, und NCCL funktioniert mit MIG nicht – verteiltes Training lässt sich auf Scheiben nicht aufbauen
Welche Knoten Karten aufnehmen – und welche nicht
Ein hyperkonvergenter Knoten ist ein Server, in dem Platten, Rechenleistung und Netzwerk unter AOS zu einem Block verschmolzen sind. Platz für eine Full-Size-Karte ist nicht immer da – Laufwerkskäfige und Lüfter fressen ihn. Deshalb nehmen manche NX-Modelle bis zu vier Beschleuniger auf und andere keinen.
| KNOTEN | FORMFAKTOR | GPUs |
|---|---|---|
| NX-9151-G9 | 2U1N | bis 4× L40S oder H100 NVL 94 GB |
| NX-3155-G9 | 2U1N | bis 2× L40S oder bis 4× L4 |
| NX-8150G-G10 | 2U1N | bis 3× L4, A16 oder L40S |
| NX-8155AS-G10 | 2U1N | bis 3× L4 oder A16 |
| NX-1175S-G10 | 1U1N | bis 2× L4 |
| NX-1150S-G9 | 2U1N | GPU-Option für den Edge (L4) |
| NX-8170, NX-3060, NX-3035, NX-8155, NX-8155A, NX-8173AS, NX-1120AS | 1U1N / 2U1N / 2U2N / 2U4N | nicht auf der GPU-Liste |
Nach der Plattform-FAQ von Nutanix und dem G10-Launch-Material (G10-Knoten werden seit Oktober 2025 ausgeliefert); prüfen Sie vor der Bestellung das Spec-Sheet der exakten Generation
Die GPU-Fähigkeit am Modellcode abzulesen funktioniert nicht – die Tabelle zeigt es direkt. Verlässlich sind zwei Prüfungen: die GPU-Zeile im Spec-Sheet des Modells und die für das Chassis validierte Kartenliste. Der NX-9151-G9 akzeptiert die H100 NVL; der NX-3155-G9 mit demselben 2U1N-Formfaktor endet bei zwei L40S; die H100 80 GB PCIe ist qualifiziert, wird von Nutanix aber nicht verkauft. Strom und Airflow setzen das Limit, nicht die Gehäusegröße.
Was eine fünfte Karte blockiert
Die Leistungsspanne der Baureihe ist groß: Ein Edge-Knoten zieht ein paar hundert Watt, während ein NX-9151-G9 mit vier 350-W-Karten ein Leistungsbudget von mehreren kVA und ein passendes Kühlbudget braucht – ein eigenes Gespräch mit Ihrem Rechenzentrum über Phase und Reihenkühlung.
Der zweite Grund: Serverkarten sind passiv. L40S und RTX PRO 6000 Server Edition haben keine eigenen Lüfter und leben vom Front-to-Back-Airflow des Chassis. In NVIDIAs Forum steht ein bezeichnender Fall: eine L40S in einer Dell-Precision-Workstation, im Leerlauf bei 100 °C. Außerhalb eines Servers ist das nicht behebbar.
Drei Wege, eine Karte an eine VM zu geben
| METHODE | WIE GETEILT WIRD | ISOLATION & LIZENZ |
|---|---|---|
| Passthrough | ganze Karte an eine VM | vollständig; keine vGPU-Lizenz nötig |
| Time-sliced vGPU | Zeitteilung, Prozesse wechseln sich ab | eigener Framebuffer pro VM, geteilte Rechenleistung, keine Fehlerisolation; Lizenz Pflicht |
| MIG-gestützte vGPU | parallel arbeitende Hardware-Scheiben | Hardware-Isolation; NVIDIAs Sizing-Guide maß bei der 48-GB-Profilgröße 20% mehr Leistung als mit Time-Slicing |
Dann kommt das Limit, an dem die Hälfte aller Multi-Karten-Pläne scheitert. Die MIG-Dokumentation sagt es klar: Mit aktiviertem MIG gibt es kein Peer-to-Peer zwischen Instanzen auf verschiedenen GPUs, weder über PCIe noch über NVLink, und NCCL ist nicht unterstützt. NVIDIAs Forums-Position: Verteiltes Training über MIG lässt sich theoretisch durch GPUDirect RDMA übers Netz drücken, ist aber langsamer, als eine größere Scheibe zu nehmen oder MIG abzuschalten. Eine Karte partitionieren und schneller Karte-zu-Karte-Austausch schließen einander aus.
Welche Karte sich wie weit teilt
| KARTE | MAX. MIG-INSTANZEN | KLEINSTE SCHEIBE |
|---|---|---|
| RTX PRO 6000 Blackwell SE, 96 GB | 4 | 1g.24gb – 24 GB, 46 SM |
| RTX PRO 4500 Blackwell, 32 GB | 2 | 1g.16gb – 16 GB |
| H100 NVL, 94 GB (die H100, die Nutanix verkauft) | 7 | 1g.12gb – 12 GB |
| H200 NVL, 141 GB | 7 | 1g.18gb – 18 GB |
| L40S, L4, A2, A16 | kein MIG | nur Passthrough oder Time-sliced vGPU |
Die letzte Zeile verdient Aufmerksamkeit bei der Knotenwahl: Die L40S ist die Arbeitskarte für NX-9151-G9 und NX-3155-G9 – und genau sie lässt sich nicht schneiden. „Wie partitionieren wir dann die L40S?“ ist eine Frage, die in NVIDIAs Forum Leute stellen, die die Karte nach TFLOPS gewählt und das Partitionierungsmodell erst danach angeschaut haben.
Was auf AHV funktioniert
NVIDIA pflegt eine eigene Support-Seite für Nutanix AHV und stuft den Hypervisor als generisches Linux mit KVM ein. Gewöhnliches Time-sliced vGPU funktioniert. Aber in der konsolidierten Feature-Tabelle ist MIG-gestützte vGPU nur für vSphere, Red Hat KVM und Ubuntu KVM ab Release 19.0 angehakt. Prüfen Sie die Kompatibilität für Ihre AOS-Version vor der Bestellung.
Zwei weitere Dinge tauchen nach dem Deployment auf. Live-Migration einer vGPU-VM verlangt die identische physische Karte auf dem Zielhost und einen Treiber aus demselben Release-Zweig in derselben oder einer neueren Version – und funktioniert nie zwischen verschiedenen MIG-Profilen. Und das Verhalten ohne Lizenz: 20 Minuten volle Geschwindigkeit, dann eine Begrenzung auf 15 fps mit eingeschränktem CUDA; nach 24 Stunden 3 fps und kein CUDA. C-Compute-Profile gibt es nur mit NVIDIA AI Enterprise (lizenziert pro GPU), Grafik-vWS pro gleichzeitigem Nutzer – zwei getrennte Budgetzeilen.
Wie viele VMs pro Karte
| vGPU-TYP | SPEICHER PRO VM | VMs PRO KARTE |
|---|---|---|
| DC-96C | 96 GB | 1 |
| DC-48C | 48 GB | 2 |
| DC-24C | 24 GB | 4 |
| DC-12C | 12 GB | 8 |
| DC-8C | 8 GB | 12 |
Compute-Profile für die RTX PRO 6000 Blackwell Server Edition
Für virtuelle Desktops nennt NVIDIAs Sizing-Guide zwei bis vier schwere Nutzer pro RTX PRO 6000 (Profile DC-12Q bis DC-24Q) und sechs bis acht leichte Nutzer pro RTX PRO 4500 Server Edition (DC-4Q). Und der budgetschonende Vorbehalt: Der Best-Effort-Scheduler erlaubt oft eine 2–3-fach höhere Nutzerdichte. Die Monitoring-Regel ist simpel – die Videospeicher-Füllung einer VM sollte selten über 90% gehen und im Schnitt unter 70% liegen.
| GEMESSEN WURDE | OHNE PARTITIONIERUNG | MIT MIG |
|---|---|---|
| flan-t5-base auf A100 40 GB (Red Hat) | ~4.200 Tok/s | ~9.800 Tok/s auf 7 Scheiben |
| P95-Latenz neben lauten Nachbarn | ~2.499 ms | ~1.319 ms (vLLM, Community-Test) |
| Kleine Einzelaufgabe auf 1/7-Scheibe | 0,00533 s | 0,02640 s (NVIDIA-Forum) |
Die letzte Zeile ist der Preis der Partitionierung: Eine einzelne Scheibe ist rund fünfmal langsamer als die ganze Karte. Der Gesamtdurchsatz wächst trotzdem, weil ein kleines Modell eine A100 nicht sättigt – und die Skalierung ist sublinear.
Wo anfangen und wie wachsen
Die funktionierende Startkonfiguration besteht aus drei Knoten: RF2-Replikation läuft auf dreien, und der Cluster übersteht den Verlust eines Knotens, ohne VMs zu stoppen. Karten braucht nicht jeder Knoten – das Muster, das am häufigsten funktioniert: drei Knoten für allgemeine Workloads, einer oder zwei davon mit Beschleunigern für Inferenz.
Halten Sie den GPU-Pool homogen – der Grund ist die Live-Migration. Ein zweiter Knoten mit derselben Karte gibt Reserve und einen Ort, wohin VMs während der Wartung ziehen. Ein gemischter Cluster mit einer L40S in einem Knoten und einer RTX PRO 6000 im anderen funktioniert auch – aber jede geplante Wartung wird zu einem Abend voller Service-Stopps.
Was wir liefern
Eurokommerz liefert die Nutanix-NX-Baureihe zusammen mit den GPUs, die Nutanix dafür listet – L40S, L4, A16 und H100 NVL – sowie die RTX PRO 6000 Server Edition auf den neuesten Knoten, mit EU-Rechnung und Herstellergarantie. Deployment und Virtualisierungs-Engineering kommen von unserem Partner Vixen.UNO unter demselben Vertrag.
FAQ
Welche Nutanix-NX-Knoten unterstützen GPUs?
Wie viele GPUs passen in einen NX-3155-G9?
Unterstützt der NX-8155-G9 die H100?
Die L40S unterstützt kein MIG. Wie teilen wir sie?
Brauchen wir AI Enterprise, um eine MIG-Instanz an eine VM zu geben?
Die Karte meldet 450 W statt 600. Ist sie defekt?
Was bringen zwei Karten im Knoten gegenüber einer?
Können wir L40S- und RTX-PRO-6000-Knoten in einem Cluster mischen?
Nennen Sie uns die Modelle, die Sie betreiben, und die Zahl der Personen, die damit arbeiten – ein Ingenieur wählt Knoten und Kartenzahl, kalkuliert die Lizenzen und sagt, wo die Konfiguration ans Strom-Limit des Racks stößt. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages