VMware Private AI Foundation with NVIDIA: was sie ist, was sie braucht und wann sie sich eignet
- Version 9.1 von VMware Private AI Foundation with NVIDIA erschien am 12. Mai 2026 und Version 9.1.1 am 3. September 2026: Deep Learning VMs, Kubernetes-Cluster mit GPUs auf VKS und Private AI Services, alles auf VCF 9.1
- Broadcoms Anforderungen nennen drei Lizenzen: ein VCF-Abonnement, die in Kernen gezählte Lizenz für Private AI Foundation und NVIDIA AI Enterprise für vGPU; seit dem 3. November 2025 kann ein VCF-Abonnement die zweite bereits enthalten
- Mit vGPU ist NVIDIA AI Enterprise für den Hosttreiber auf ESX und die Gasttreiber erforderlich, gezählt pro physischer GPU; seit Version 9.1 dokumentiert Broadcom DirectPath-GPUs ohne AI Enterprise, NVIDIA verlangt jedoch eine Lizenz pro GPU, sobald darauf AI-Enterprise-Software wie NIM läuft
- Der erste Cluster der GPU-Workload-Domain braucht mindestens 3 GPU-fähige ESX-Hosts, und Broadcom verweist zur Prüfung jeder GPU auf seinen Compatibility Guide für KI/ML-Compute
- Private AI Services 3.0, erschienen am 3. September 2026, betreibt Modelle mit vLLM 0.20.0 auf der GPU, mit Infinity für Embeddings und mit llama.cpp auf der CPU und unterstützt PostgreSQL 16.8 mit pgvector 0.8.0 für RAG-Vektoren
Was sie ist, Stand September 2026
Broadcom beschreibt VMware Private AI Foundation with NVIDIA als „eine Lösung aus mehreren Komponenten“, die „auf dem Management der virtuellen Infrastruktur und dem Cloud-Management von VCF aufbaut, um generative KI-Workloads auf Systemen mit NVIDIA-GPU-Geräten auszuführen“. Im März 2024 erreichte sie als Add-on zu VMware Cloud Foundation die Initial Availability, und ihre Versionsnummern folgen denen von VCF: Version 9.0 erschien am 17. Juni 2025, Version 9.1 am 12. Mai 2026 und Version 9.1.1 am 3. September 2026. Dieser Leitfaden folgt der Dokumentation zu Version 9.1, die Broadcom zuletzt am 21. September 2026 aktualisiert hat. Nicht behandelt wird VMware AI Factory, die Broadcom am 31. August 2026 als „die softwaredefinierte Grundlage von VMware Private AI Cloud“ angekündigt hat.
Die Dokumentation nennt zwei Wege: Deep Learning VMs, die Administratoren für Data Scientists bereitstellen, und Kubernetes-Cluster aus dem vSphere Kubernetes Service (VKS) für produktive Workloads. Private AI Services fügt eine dritte Ebene hinzu, in der Modelle, Retrieval und Agenten als gemeinsamer Dienst laufen.
Welche Teile von Broadcom kommen und welche von NVIDIA
Jede Seite bringt ihre eigene Lizenz und ihren eigenen Supportweg mit. Broadcoms Dokumentation zu Version 9.1 nennt diese Komponenten.
| KOMPONENTE | HERKUNFT | AUFGABE |
|---|---|---|
| vCenter, ESX, NSX | Broadcom, in VCF | die Plattform; Knoten vom Typ NSX Edge oder Virtual Network Appliance übernehmen das Nord-Süd-Routing des Supervisors |
| Supervisor und VKS | Broadcom, in VCF | VMs und Kubernetes-Cluster auf Anforderung, mit vGPU oder Passthrough-GPUs |
| VCF Automation | Broadcom, in VCF | Self-Service-Katalogelemente wie „AI Workstation“ und „AI Kubernetes Cluster“ |
| VCF Operations | Broadcom, in VCF | GPU-Metriken pro Cluster, Host und GPU, mit den Dashboards „Private AI (GPU)“ |
| Image der Deep Learning VM | Broadcom | Ubuntu mit Docker, dem NVIDIA Container Toolkit und conda; PyTorch, Triton oder DCGM Exporter aus NGC lassen sich vorinstallieren |
| Private AI Services | Broadcom | ein Supervisor Service: Modellgalerie in Harbor, Modell-Endpunkte, Wissensdatenbanken, Agenten, MCP-Server |
| Data Services Manager | Broadcom | PostgreSQL mit pgvector, die Vektordatenbank |
| vGPU-Host- und Gasttreiber | NVIDIA AI Enterprise | ein VIB auf jedem ESX-Host und der passende Treiber in jeder VM oder auf jedem Node |
| NVIDIA License System | NVIDIA | vGPU-Lizenzen aus dem Licensing Portal oder von einer Appliance des Delegated License Service |
| GPU- und Network Operator | NVIDIA | GPU-Software in VKS-Clustern; Netzwerk mit RDMA und GPUDirect |
| NVIDIA NGC | NVIDIA | GPU-optimierte Container, darunter NIM-Microservices auf VKS |
Broadcom TechDocs, „VMware Private AI Foundation with NVIDIA 9.1“ und VCF 9.1, Seiten aktualisiert vom 15. Juli bis 23. September 2026. Eine Passthrough-GPU nutzt NVIDIAs Rechenzentrumstreiber statt der vGPU-Treiber.
Drei Lizenzpositionen
Broadcoms Anforderungen für Version 9.1 nennen drei Lizenzen; ein Cluster, der vGPU nutzt, braucht alle drei.
VCF-Abonnement. VCF wird pro physischem Kern lizenziert, mit mindestens 16 Kernen je Prozessor, wie unser Leitfaden zur VMware-Verlängerung darlegt. Die Anforderungen nennen ein VCF-Abonnement; wir haben keine Erwähnung von vSphere Foundation oder den eigenständigen vSphere-Editionen gefunden.
Lizenz für Private AI Foundation. Broadcoms Lizenzübersicht zu VCF 9.1 nennt sie „VMware Private AI Foundation with NVIDIA (cores)“. Broadcoms Anforderungen weisen sie der GPU-fähigen Workload-Domain zu; wird sie zusätzlich dem vCenter der Management-Domain als Add-on zugewiesen, aktiviert das die Oberfläche für die geführte Bereitstellung im vSphere Client und den Quickstart-Assistenten in VCF Automation, und „die Lizenzkapazität wird nur den GPU-fähigen Workload-Domains zugeteilt und nicht der Management-Domain“. Was die VCF-Lizenz allein abdeckt, beschreibt Broadcom so: „Sie können KI-Workloads mit und ohne aktivierten Supervisor bereitstellen und die GPU-Metriken in vCenter und VCF Operations unter der VCF-Lizenz nutzen“; die Tabelle zeigt, was die Lizenz für Private AI Foundation hinzufügt. Womöglich ist sie schon im Konto: Seit dem 3. November 2025 „erhalten Sie auf Grundlage Ihres VCF-Abonnements möglicherweise auch eine Lizenz“ dafür, und die FAQ zu VCF 9.1 vom 3. September 2026 führt VCF Private AI Services als Komponente von VCF. Prüfen Sie den Anspruch vor der Bestellung.
NVIDIA AI Enterprise. Broadcom verlangt diese Lizenz „für den Betrieb von KI-Workloads auf vGPU“, für „die VIB-Datei des Hosttreibers auf ESX-Hosts und die Treiber des Gastbetriebssystems“, und NVIDIA lizenziert vGPU for Compute „nur über NVIDIA AI Enterprise“, pro physischer GPU. Unser Lizenzleitfaden behandelt den Lizenzserver, die enthaltenen Abonnements und NVIDIAs Supportbedingung, ein NVIDIA-Certified System. Broadcoms Release Notes zu Version 9.1 führen die DirectPath-Aktivierung für GPUs als Neuerung auf: VMs und Kubernetes-Nodes erhalten „exklusiven Zugriff auf GPU-Ressourcen, ohne dass eine Lizenz für NVIDIA AI Enterprise (NVAIE) nötig ist“. Das deckt die GPU und ihren Treiber ab; NVIDIA verlangt weiterhin eine Lizenz für jede GPU in einem Server, auf dem AI-Enterprise-Software läuft, etwa NIM-Microservices in der Produktion.
| LIZENZ | GEZÄHLT IN | SCHALTET FREI | NÖTIG FÜR |
|---|---|---|---|
| VCF-Abonnement | physische Kerne, mindestens 16 je Prozessor | vSphere, vSAN, NSX, VKS, VCF Operations, VCF Automation; GPU-Metriken | jeden VCF-Host |
| Private AI Foundation | Kerne, zugeteilt an GPU-fähige Workload-Domains | Katalogelemente, Image der Deep Learning VM, geführte Bereitstellung, pgvector in Data Services Manager, Private AI Services | diese Funktionen; kann seit dem 3. November 2025 in VCF enthalten sein |
| NVIDIA AI Enterprise | physische GPUs, jede GPU in einem Server, auf dem die Software läuft | vGPU-Host- und Gasttreiber; KI-Container aus NGC, laut Broadcom | vGPU sowie AI-Enterprise-Software wie NIM in der Produktion; nicht für GPU-Zugriff über DirectPath in Version 9.1 |
Broadcom TechDocs: Anforderungen, Lizenzzuweisung und Release Notes zu Private AI Foundation 9.1, Lizenzseiten zu VCF 9.1, September 2026; Dokumentation zu NVIDIA AI Enterprise, 2. September 2026.
Die beiden Broadcom-Positionen mit dem abzugleichen, was in der Umgebung laufen wird, ist der Lizenzteil unserer VMware-Optimierung, bei der unser Engineering-Partner Vixen.UNO die Umgebung und ihre Lizenzen auditiert und Editionen und Abonnements auf die realen Workloads abstimmt, innerhalb der aktuellen Broadcom-Lizenzlogik; die Zahl der Lizenzen für NVIDIA AI Enterprise kommt gemeinsam mit der Hardware ins Angebot, wie unsere Seite zu NVIDIA AI Enterprise erklärt.
Welche GPUs und Server die Dokumente nennen
Broadcom legt die Zahl der Hosts fest: „mindestens 3 GPU-fähige ESX-Hosts, die in den ersten Cluster einer Workload-Domain aufgenommen werden“. Seine Anforderungen für Version 9.1 nennen keine GPU-Modelle; sie verlangen, „im Broadcom Compatibility Guide for GPUs and Accelerators for AI/ML Compute zu prüfen, ob die GPUs auf Ihren ESX-Hosts unterstützt werden“. Der Compatibility Guide ist ein Online-Suchwerkzeug. vGPU-Hosts brauchen im BIOS aktiviertes SR-IOV und NVIDIAs vGPU-Hosttreiber. Für Advanced NIC Passthrough nennen die Anforderungen die NVIDIA ConnectX-6 Dx, nur für Enhanced DirectPath I/O, die ConnectX-7 und die BlueField-3 im NIC-Modus. Die Release Notes zu Version 9.1 ergänzen außerdem NVIDIA-HGX-Plattformen mit Blackwell-GPUs und NVSwitch; auf HGX B200 und B300 mit vSphere unterstützt NVIDIA AI Enterprise nur VMs mit ganzen GPUs und VMs mit mehreren vGPUs, keine fraktionalen vGPUs.
NVIDIAs vGPU-Dokumentation für vSphere, Releases 20.0 bis 20.2, nennt Hosttreiberpakete für VCF 9.1, VCF 9.0 und vSphere 8.0, und ihre GPU-Liste enthält die L4, die L40S und die RTX PRO 6000 Blackwell Server Edition. NVIDIA AI Enterprise 8.2, dessen Support-Matrix VMware ESXi „8.0 und neuer, 9.0 und neuer“ abdeckt, führt außerdem die H200 NVL, mit Compute-vGPU-Profilen.
| KARTE | SPEICHER UND MIG | NVIDIA AUF VSPHERE | AI ENTERPRISE |
|---|---|---|---|
| RTX PRO 6000 Server Edition | 96 GB, bis zu 4 MIG-Instanzen | auf der vGPU-Liste, in der 9.0-Linie ab VCF 9.0.1; in AI Enterprise 8.2 | nicht enthalten, pro GPU lizenziert |
| H200 NVL | 141 GB, bis zu 7 MIG-Instanzen | in AI Enterprise 8.2, mit Compute-vGPU-Profilen | Fünf-Jahres-Abonnement enthalten |
| L40S | 48 GB, kein MIG | auf der vGPU-Liste; in AI Enterprise 8.2 | nicht enthalten, pro GPU lizenziert |
| L4 | 24 GB, kein MIG | auf der vGPU-Liste; in AI Enterprise 8.2 | nicht enthalten, pro GPU lizenziert |
| Workstation-Editionen | RTX PRO 6000 Workstation und Max-Q 96 GB, 5000 48 oder 72 GB, 4500 32 GB, 4000 24 GB | nicht auf NVIDIAs vGPU-Liste für vSphere | nicht in der Support-Matrix von Version 8.2 |
NVIDIAs vGPU-Dokumentation für VMware vSphere, 22. September 2026; Support-Matrix und vGPU-Typen von NVIDIA AI Enterprise 8.2, 2. September 2026; Zahl der MIG-Instanzen aus NVIDIAs MIG-Benutzerhandbuch. Das Abonnement der H200 NVL wird mit der Seriennummer der GPU aktiviert.
Wir planen solche Cluster mit den Karten, die NVIDIA für vGPU auf vSphere listet, etwa der RTX PRO 6000 Server Edition, der L40S und der L4, oder mit der H200 NVL, die NVIDIA AI Enterprise 8.2 mit Compute-vGPU-Profilen listet. Die H200 NVL verändert außerdem die Lizenzposition: Jede Karte enthält ein fünfjähriges Abonnement für NVIDIA AI Enterprise, das mit ihrer Seriennummer aktiviert wird, und die fünf Jahre beginnen 90 Tage nach der Auslieferung der Karte an den Serverhersteller, nicht mit der Aktivierung, so NVIDIAs Lizenzleitfaden; die anderen drei Karten brauchen für vGPU eine Lizenz pro GPU.
Was ein Administrator aufbaut
In der Management-Domain laufen vCenter, NSX Manager, VCF Operations, VCF Automation und Data Services Manager. Die GPUs kommen in eine Workload-Domain, in der „die Option vSphere Supervisor obligatorisch ist“, mit einem NSX-Edge- oder Virtual-Network-Appliance-Cluster für das Nord-Süd-Routing des Supervisors. Die GPUs jedes Hosts werden für vGPU auf Shared Direct gestellt, mit Time-Sliced- oder MIG-gestützten Profilen, oder für Passthrough auf Fixed oder Dynamic DirectPath, und anschließend wird der Host im Wartungsmodus neu gestartet. Eine Passthrough-VM erhält die ganze Karte, was laut Broadcom „zu besserer Leistung führt“, Deep Learning VMs mit Passthrough-GPUs lassen sich aber nicht mit vSphere vMotion zwischen Hosts verschieben. Was jeder Modus erlaubt und blockiert, von DRS über HA bis zu Snapshots, steht in unserem Leitfaden zu Passthrough oder vGPU.
Nutzer erreichen die GPUs über VM-Klassen, in denen „Sie als VI-Administrator die Anforderungen an Rechenleistung, Netzwerk und GPU entsprechend der GPU-Konfiguration auf den ESX-Hosts festlegen“. Jede Klasse enthält ein vGPU- oder Passthrough-Profil, und reservierte Klassen werden „einer Organisation in VCF Automation“ zugewiesen, sodass die GPU-Kapazität zu einem Katalog wird, den das VI-Team kontrolliert. Der Private AI Foundation Quickstart legt dann die Katalogelemente an, darunter „AI Workstation“, das eine Deep Learning VM bereitstellt, und „AI Kubernetes Cluster“, ein VKS-Cluster mit dem NVIDIA GPU Operator. Broadcom weist darauf hin, dass der GPU Operator v25.3.1 dieses Katalogelements „sein End-of-Life erreicht hat“; der KB-Artikel 439984 beschreibt die Umstellung des Blueprints auf v26.3.1.
Private AI Services wird „als Supervisor Service installiert“, pro Namespace in VCF Automation aktiviert und braucht eine Harbor-Registry für die Modellgalerie; Version 3.0 braucht Data Services Manager, für die pgvector-Datenbank, wenn Wissensdatenbanken und Agenten genutzt werden. Model Runtime stellt Modelle hinter einer OpenAI-kompatiblen API mit Open-Source-Engines bereit: vLLM für Modelle auf der GPU, Infinity für Embeddings, llama.cpp auf der CPU. Version 3.0 vom 3. September 2026, für VCF 9.1.x, nennt vLLM 0.20.0, llama.cpp b9309 und Infinity 0.0.76 als ihre Inferenz-Engines und unterstützt PostgreSQL 16.8 mit pgvector 0.8.0.
RAG und die Vektordatenbank
Broadcoms Release Notes zu Version 9.1.x führen die Katalogelemente von VCF Automation für NVIDIA RAG als entfernt auf, weil „NVIDIA die Blueprints, auf denen diese Katalogelemente beruhen, nicht mehr unterstützt“. Das Retrieval ist jetzt in Private AI Services angesiedelt: Eine Wissensdatenbank „besteht aus Metadaten, Textabschnitten und Vektor-Embeddings, die für jedes verarbeitete Dokument im Rahmen einer Datenquelle erzeugt werden“, eingebettet über einen Endpunkt von Model Runtime und in pgvector indiziert. Dokumente werden als PDF-, DOCX-, PPTX-, TXT-, HTML-, Markdown- oder CSV-Dateien hochgeladen oder aus verknüpften Quellen gelesen, etwa aus Google-Drive-Ordnern, Confluence-Bereichen und S3-kompatiblen Speichern, jeweils mit einem Satz Zugangsdaten.
In der Dokumentation zu Version 9.1 haben wir nichts zur Übernahme der Dokumentberechtigungen jedes Nutzers in die Antworten gefunden. Wo verschiedene Personen verschiedene Dokumente sehen dürfen, muss diese Trennung konzipiert werden, bevor die erste Wissensdatenbank befüllt wird; RAG-Assistenten, die die Zugriffsrechte jedes Nutzers beachten, sind Teil unserer Arbeit in der KI/ML-Integration.
Wann sie sich eignet und wann ein schlankerer Stack genügt
Sie eignet sich, wenn die Umgebung bereits auf VCF 9.1 läuft oder ihr Modernisierungsplan dorthin führt und die Lizenz für Private AI Foundation im Abonnement enthalten ist; wenn mehrere Teams GPU-VMs und Kubernetes-Cluster als Self-Service brauchen, betrieben wie das übrige vSphere; wenn Modelle als gemeinsamer Dienst mit Endpunkten, Wissensdatenbanken und Agenten laufen sollen, auch an einem Standort ohne Verbindung nach außen, da Version 9.1 die Installation von Private AI Services in Air-Gapped-Umgebungen unterstützt; und wenn das Budget mindestens drei GPU-Hosts im ersten Cluster abdeckt, dazu NVIDIA AI Enterprise pro GPU überall dort, wo vGPU oder AI-Enterprise-Software zum Einsatz kommt.
Ein schlankerer Stack genügt, wenn ein oder zwei GPU-Server ein Team und einige wenige Modelle bedienen. Eine VM mit einer vGPU oder einer Passthrough-GPU auf dem vorhandenen vSphere-Cluster, auf der eine Open-Source-Engine wie vLLM läuft, deckt diesen Fall ab, und unser Leitfaden zur VMware-Verlängerung zeigt, welche vSphere-Editionen vGPU enthalten. Teams, für die Kubernetes an erster Stelle steht, können ihre eigene Plattform auf Bare-Metal-GPU-Nodes betreiben, wie unser Leitfaden zur Kubernetes-Plattform beschreibt. Eine Umgebung auf vSphere Foundation oder einer eigenständigen Edition beginnt mit dem oben beschriebenen VM-Weg, weil die Anforderungen ein VCF-Abonnement nennen.
Keiner der beiden Wege ist ein Urteil über die Plattform; die entscheidenden Fragen sind die Größenordnung, wie viele Teams sich die GPUs teilen und wer das Ergebnis betreiben wird.
Was wir liefern
Eurokommerz liefert auf Bestellung gebaute GPU-Server mit Karten vom Typ RTX PRO 6000 Server Edition, H200 NVL, L40S oder L4, von Ingenieuren pro Workload ausgelegt, mit Herstellergarantie sowie EU-Vertrag und Rechnungsstellung aus Österreich; prüfen Sie den gewählten Server und die GPUs in Broadcoms Compatibility Guide, bevor sie in eine Workload-Domain kommen. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung wie die KI-Server, und jede H200 NVL enthält NVIDIAs fünfjähriges AI-Enterprise-Abonnement. Für die VMware-Seite liefert unser Engineering-Partner Vixen.UNO die VMware-Optimierung: ein Audit der Umgebung und ihrer Lizenzen, auf die realen Workloads abgestimmte Editionen und Abonnements sowie die Modernisierung von vSphere, vSAN, NSX und VCF in vereinbarten Wartungsfenstern, mit einem Rollback-Plan für jede Etappe. Für die KI-Ebene liefert dasselbe Team die KI/ML-Integration: private LLMs mit vLLM, Ollama oder NVIDIA AI Enterprise, RAG-Assistenten, die die Zugriffsrechte jedes Nutzers beachten, und die Protokollierung von Anfragen und Antworten. Der Vertrag läuft mit Eurokommerz, das Engineering liefert das Team von Vixen.UNO.
FAQ
Was ist VMware Private AI Foundation with NVIDIA?
Ist Private AI Foundation in einem VCF-Abonnement enthalten?
Brauche ich NVIDIA AI Enterprise für Private AI Foundation?
Wie viele GPU-Hosts braucht Private AI Foundation?
Welche NVIDIA-GPUs unterstützt Private AI Foundation?
Welche Inferenz-Engines nutzt Private AI Services?
Schicken Sie uns Ihre VCF-Version, die Hostliste und die GPUs, die Sie betreiben oder planen, und sagen Sie uns, welche KI-Workloads darauf laufen sollen. Sie erhalten von uns die Lizenzpositionen, eine GPU-Serverkonfiguration und ein erstes Assessment-Gespräch. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages