Nutanix und GPUs: Aufbau eines KI-Clusters
- Von fünfzehn NX-Modellen nehmen elf GPUs auf. Die Obergrenze pro Knoten: vier H100 oder L40S im NX-9151-G9
- Der Buchstabe N im Modellcode sagt nichts über GPUs: Der NX-8155N-G8 nimmt drei Karten, der NX-8150N-G8 keine
- Die L40S lässt sich mit MIG gar nicht teilen; die RTX PRO 6000 Server Edition teilt sich in vier 24-GB-Instanzen
- MIG-gestützte vGPU ist für vSphere, Red Hat KVM und Ubuntu KVM gelistet — AHV wird nicht genannt
- MIG aktivieren schaltet NVLink und P2P ab, und NCCL funktioniert damit nicht — verteiltes Training lässt sich auf Scheiben nicht aufbauen
Welche Knoten Karten aufnehmen — und welche nicht
Ein hyperkonvergenter Knoten ist ein Server, in dem Platten, Rechenleistung und Netzwerk unter AOS zu einem Block verschmolzen sind. Platz für eine Full-Size-Karte ist nicht immer da — Laufwerkskäfige und Lüfter fressen ihn. Deshalb nehmen manche NX-Modelle bis zu vier Beschleuniger auf und andere keinen.
| KNOTEN | FORMFAKTOR | GPUs |
|---|---|---|
| NX-9151-G9 | 2U1N | bis 4× H100 oder L40S |
| NX-3155-G9 | 2U1N | bis 4× A2, L4, L40S oder H100 |
| NX-8155-G9 | 2U1N | bis 3× A2, L4 oder L40S |
| NX-8155N-G8 | 2U1N | bis 3× A2 oder L4 |
| NX-8155A-G9 | 2U1N | 2× A100 80 GB |
| NX-3035-G9, NX-1175S-G9 | 2U2N / 1U1N | bis 2× A2 oder L4 |
| NX-1150S-G9 | 2U1N | 0 oder 1× L4 24 GB |
| NX-8150-G9, NX-8170-G9, NX-8150N-G8, NX-8170N-G8 | 1U1N / 2U1N | nicht unterstützt |
Nach Nutanix-Knotenspezifikationen; die letzte Zeile sind Datenbank- und Storage-Knoten
Die GPU-Fähigkeit am Buchstabensuffix abzulesen funktioniert nicht — die Tabelle zeigt es direkt. Verlässlich sind zwei Prüfungen: die GPU-Zeile im Spec-Sheet des Modells und die für das Chassis validierte Kartenliste. NX-9151-G9 und NX-3155-G9 akzeptieren die H100; der NX-8155-G9 mit demselben 2U1N-Formfaktor endet bei der L40S. Strom und Airflow setzen das Limit, nicht die Gehäusegröße.
Was eine fünfte Karte blockiert
Die Leistungsspanne der Baureihe ist sechsfach: Ein NX-1150S-G9 erreicht in der Spitze 531 VA, während ein NX-9151-G9 mit vier Karten 3.232 VA verlangt und bis zu 11.021 BTU pro Stunde abgibt — ein eigenes Gespräch mit Ihrem Rechenzentrum über Phase und Reihenkühlung.
Der zweite Grund: Serverkarten sind passiv. L40S und RTX PRO 6000 Server Edition haben keine eigenen Lüfter und leben vom Front-to-Back-Airflow des Chassis. In NVIDIAs Forum steht ein bezeichnender Fall: eine L40S in einer Dell-Precision-Workstation, im Leerlauf bei 100 °C. Außerhalb eines Servers ist das nicht behebbar.
Drei Wege, eine Karte an eine VM zu geben
| METHODE | WIE GETEILT WIRD | ISOLATION & LIZENZ |
|---|---|---|
| Passthrough | ganze Karte an eine VM | vollständig; keine vGPU-Lizenz nötig |
| Time-sliced vGPU | Zeitteilung, Prozesse wechseln sich ab | keine Speicher-/Fehlerisolation; Lizenz Pflicht |
| MIG-gestützte vGPU | parallel arbeitende Hardware-Scheiben | Hardware-Isolation, ~20% schneller als Time-Slicing |
Dann kommt das Limit, an dem die Hälfte aller Multi-Karten-Pläne scheitert. Die MIG-Dokumentation sagt es klar: Mit aktiviertem MIG sind die NVLink-Links aus, die Karte verliert P2P, und NCCL ist nicht unterstützt. NVIDIAs Forums-Position: Verteiltes Training über MIG lässt sich theoretisch durch GPUDirect RDMA übers Netz drücken, ist aber langsamer, als eine größere Scheibe zu nehmen oder MIG abzuschalten. Eine Karte partitionieren und schneller Karte-zu-Karte-Austausch schließen einander aus.
Welche Karte sich wie weit teilt
| KARTE | MAX. MIG-INSTANZEN | KLEINSTE SCHEIBE |
|---|---|---|
| RTX PRO 6000 Blackwell SE, 96 GB | 4 | 1g.24gb — 24 GB, 46 SM |
| RTX PRO 4500 Blackwell, 32 GB | 2 | 1g.16gb — 16 GB |
| H100 PCIe, 80 GB | 7 | 1g.10gb — 10 GB |
| H200 NVL, 141 GB | 7 | 1g.18gb — 18 GB |
| L40S, L4, A2, A16 | kein MIG | nur Passthrough oder Time-sliced vGPU |
Die letzte Zeile verdient Aufmerksamkeit bei der Knotenwahl: Die L40S ist die Arbeitskarte für NX-9151-G9 und NX-3155-G9 — und genau sie lässt sich nicht schneiden. „Wie partitionieren wir dann die L40S?“ ist eine Frage, die in NVIDIAs Forum Leute stellen, die die Karte nach TFLOPS gewählt und das Partitionierungsmodell erst danach angeschaut haben.
Was auf AHV funktioniert
NVIDIA pflegt eine eigene Support-Seite für Nutanix AHV und stuft den Hypervisor als generisches Linux mit KVM ein. Gewöhnliches Time-sliced vGPU funktioniert. Aber in der konsolidierten Feature-Tabelle ist MIG-gestützte vGPU nur für vSphere, Red Hat KVM und Ubuntu KVM ab Release 19.0 angehakt. Prüfen Sie die Kompatibilität für Ihre AOS-Version vor der Bestellung.
Zwei weitere Dinge tauchen nach dem Deployment auf. Live-Migration einer vGPU-VM verlangt die identische physische Karte, Treiberversion und Hypervisor-Version auf dem Zielhost — und funktioniert nie zwischen verschiedenen MIG-Profilen. Und das Verhalten ohne Lizenz: 20 Minuten volle Geschwindigkeit, dann 1280×1024 bei drei Bildern pro Sekunde mit CUDA aus. C-Compute-Profile gibt es nur mit NVIDIA AI Enterprise (lizenziert pro GPU), Grafik-vWS pro gleichzeitigem Nutzer — zwei getrennte Budgetzeilen.
Wie viele VMs pro Karte
| vGPU-TYP | SPEICHER PRO VM | VMs PRO KARTE |
|---|---|---|
| DC-96C | 96 GB | 1 |
| DC-48C | 48 GB | 2 |
| DC-24C | 24 GB | 4 |
| DC-12C | 12 GB | 8 |
| DC-8C | 8 GB | 12 |
Compute-Profile für die RTX PRO 6000 Blackwell Server Edition
Für Arbeitsplätze nennt NVIDIA für beide RTX-PRO-Karten dieselbe Dichte: zwei bis vier schwere Nutzer pro Karte, drei bis sechs mittlere, sechs bis acht leichte. Und der budgetschonende Vorbehalt: Der Best-Effort-Scheduler erlaubt oft eine 2–3-fache Überbuchung. Die Monitoring-Regel ist simpel — die Videospeicher-Füllung einer VM sollte selten über 90% gehen und im Schnitt unter 70% liegen.
| GEMESSEN WURDE | OHNE PARTITIONIERUNG | MIT MIG |
|---|---|---|
| flan-t5-base auf A100 40 GB | ~3.400 Tok/s | ~9.800 Tok/s auf 7 Scheiben |
| Sprach-Pipeline auf A100 | 0,74 Anfr./s | 1,00 (Time-Slicing: 0,76) |
| P95-Latenz neben lauten Nachbarn | ~2.499 ms | ~1.319 ms |
| Einzelaufgabe auf einer 1/7-Scheibe | 0,00533 s | 0,02640 s |
Die letzte Zeile ist der Preis der Partitionierung: Eine einzelne Scheibe ist rund fünfmal langsamer als die ganze Karte. Der Gesamtdurchsatz wächst trotzdem, weil ein kleines Modell eine A100 nicht sättigt — und die Skalierung ist sublinear.
Wo anfangen und wie wachsen
Die funktionierende Startkonfiguration besteht aus drei Knoten: RF2-Replikation läuft auf dreien, und der Cluster übersteht den Verlust eines Knotens, ohne VMs zu stoppen. Karten braucht nicht jeder Knoten — das Muster, das am häufigsten funktioniert: drei Knoten für allgemeine Workloads, einer oder zwei davon mit Beschleunigern für Inferenz.
Halten Sie den GPU-Pool homogen — der Grund ist die Live-Migration. Ein zweiter Knoten mit derselben Karte gibt Reserve und einen Ort, wohin VMs während der Wartung ziehen. Ein gemischter Cluster mit einer L40S in einem Knoten und einer RTX PRO 6000 im anderen funktioniert auch — aber jede geplante Wartung wird zu einem Abend voller Service-Stopps.
Was wir liefern
Eurokommerz liefert die Nutanix-NX-Baureihe zusammen mit den dafür validierten GPUs — L40S, L4, H100 — plus die RTX PRO 6000 Server Edition und die H200 NVL, mit EU-Rechnung und Herstellergarantie. Deployment und Virtualisierungs-Engineering kommen von unserem Partner Vixen.UNO unter demselben Vertrag.
FAQ
Die L40S unterstützt kein MIG. Wie teilen wir sie?
Brauchen wir AI Enterprise, um eine MIG-Instanz an eine VM zu geben?
Die Karte meldet 450 W statt 600. Ist sie defekt?
Was bringen zwei Karten im Knoten gegenüber einer?
Können wir L40S- und RTX-PRO-6000-Knoten in einem Cluster mischen?
Nennen Sie uns die Modelle, die Sie betreiben, und die Zahl der Personen, die damit arbeiten — ein Ingenieur wählt Knoten und Kartenzahl, kalkuliert die Lizenzen und sagt, wo die Konfiguration ans Strom-Limit des Racks stößt. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages