BLOG · GUIDE ·

NVIDIA L4 vGPU-Profile: die Profilliste, maximale VMs pro GPU und VDI-Nutzer je Karte

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Die NVIDIA L4 hat kein MIG und wird daher nur per time-sliced vGPU geteilt; NVIDIA listet Profile der Q-Serie von 1 GB bis 24 GB, der B-Serie von 1 GB bis 3 GB, der A-Serie ab 24 GB abwärts und der C-Serie von 4 GB bis 24 GB
  • Maximale VMs je L4 im Modus gleicher Größe: 24 mit L4-1B oder L4-1Q, 12 mit L4-2B, 8 mit L4-3B, 6 mit L4-4Q oder L4-4C und 1 mit L4-24Q oder L4-24C; im Modus gemischter Größen sinkt das Maximum bei 1 GB auf 16 und bei 2 GB auf 8
  • Lizenzeditionen laut NVIDIA: Die Q-Serie braucht vWS, die B-Serie vPC oder vWS, die A-Serie vApps und die C-Serie NVIDIA AI Enterprise; vPC und vWS werden je gleichzeitigem Nutzer gezählt
  • Jede L4 hat 2 NVENC-Encoder, 4 NVDEC-Decoder und 4 JPEG-Decoder; 12 Desktops mit L4-2B teilen sich also zwei Encoder, sechs Desktops je Encoder
  • NVIDIAs vPC-Dichtetabelle nennt 16 L4 je 2U-Server als Maximum, während Lenovo 8 L4 für den SR650 V3 und 10 für den SR650 V4 listet; acht L4 mit L4-2B nehmen 96 Desktops bei 576 W Kartenleistung auf

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

NVIDIA L4 vGPU-Profile im Überblick

Die NVIDIA L4 wird zwischen virtuellen Maschinen nur per time-sliced vGPU geteilt, denn sie hat kein Multi-Instance GPU (MIG): NVIDIAs MIG User Guide, aktualisiert am 11. September 2026, führt sie nicht unter den unterstützten GPUs. Jedes vGPU-Profil der L4 gibt einer VM einen festen Anteil an den 24 GB Framebuffer der Karte, während die VMs sich ihre Rechenleistung reihum teilen. NVIDIAs vGPU-Dokumentation listet für die L4 vier Serien, Q für virtuelle Workstations, B für virtuelle Desktops, A für veröffentlichte Anwendungen und C für Compute, mit 1 bis 24 VMs je Karte, abhängig von der Größe des Framebuffers.

PROFILFRAMEBUFFERMAX. JE GPUMAX. GEMISCHTLIZENZEDITION
L4-24Q24 GB11vWS
L4-12Q12 GB22vWS
L4-8Q8 GB32vWS
L4-6Q6 GB44vWS
L4-4Q4 GB64vWS
L4-3Q3 GB88vWS
L4-2Q2 GB128vWS
L4-1Q1 GB2416vWS
L4-3B3 GB88vPC oder vWS
L4-2B2 GB128vPC oder vWS
L4-1B1 GB2416vPC oder vWS
L4-24A24 GB11vApps
L4-12A12 GB22vApps
L4-24C24 GB11NVIDIA AI Enterprise
L4-12C12 GB22NVIDIA AI Enterprise
L4-8C8 GB32NVIDIA AI Enterprise
L4-6C6 GB44NVIDIA AI Enterprise
L4-4C4 GB64NVIDIA AI Enterprise

NVIDIA Virtual GPU Types Reference im vGPU-Benutzerhandbuch (aktualisiert am 29. September 2026) für die Q- und B-Serie; die Ausgabe vGPU 19.0 derselben Referenz für die A-Serie; NVIDIA AI Enterprise 8.2, Ada Lovelace vGPU types (aktualisiert am 2. September 2026) für die C-Serie. NVIDIA gibt die Größen der Q-, B- und A-Serie in MB an, 1.024 MB je GB.

NVIDIAs Tabelle der A-Serie für die L4 setzt sich unterhalb von L4-12A mit L4-8A fort, drei je Karte; prüfen Sie die kleineren A-Größen in der Referenz, bevor Sie Hosts für veröffentlichte Anwendungen darauf planen. Die C-Serie endet bei 4 GB, die L4 hat also kein Compute-Profil mit 1 GB, 2 GB oder 3 GB. NVIDIAs Fußnote zu den Compute-Typen besagt, dass sie „nur einen einzigen Display-Head“ unterstützen und keine Quadro-Grafikbeschleunigung bieten, und jeder betreibt ein Display mit bis zu 3840×2400. Wie die L4 als Inferenzkarte im Vergleich zur L40S abschneidet, zeigt unser Vergleich von L4 und L40S für Inferenz; dieselbe Referenz für die größere Karte steht in unserem Leitfaden zu den vGPU-Profilen der L40S.

Time-sliced vGPU auf der L4: gleiche und gemischte Größen

NVIDIAs RTX vWS Sizing Guide, aktualisiert am 19. August 2026, hält fest: „Wenn MIG deaktiviert ist, müssen alle auf einer physischen GPU gehosteten vGPUs dieselbe Profilgröße (dieselbe Framebuffer-Größe) haben“. Profile derselben Größe aus verschiedenen Serien dürfen sich eine Karte teilen, etwa 2Q neben 2B in NVIDIAs Beispiel. Eine Karte mit zwölf L4-2B-Desktops kann daher anstelle eines davon eine L4-2Q-Workstation aufnehmen, aber keine L4-4Q.

Heterogene vGPU, die laut NVIDIA „mit vGPU 17.0 eingeführt wurde“, hebt diese Regel auf und lässt eine Karte verschiedene Größen aufnehmen. Das L4-Beispiel des Guides ist eine Karte, die gleichzeitig Instanzen von L4-8Q und L4-2B hostet. Auf vSphere listen NVIDIAs validierte Plattformen gemischte Größen für die L4 auf Release 9.0 sowie auf ESXi 8.0 Update 3 und neuer, was jedes Release in der Support-Matrix von vGPU 20 erfüllt. Im Modus gemischter Größen haben mehrere Größen ein niedrigeres Maximum, das die Spalte für gemischte Größen in der Tabelle zeigt: L4-8Q sinkt von 3 auf 2, L4-4Q und L4-4C von 6 auf 4, die 2-GB-Profile von 12 auf 8 und die 1-GB-Profile von 24 auf 16. Bei einem Host mit mehreren L4-Karten bleiben die höheren Zahlen erhalten, wenn jede Nutzergruppe eigene Karten im Modus gleicher Größe bekommt.

Jede VM behält ihren eigenen Framebuffer, während die Rechenleistung in Zeitscheiben geteilt wird. Laut vWS-Guide „verwendet“ die vGPU-Software „standardmäßig den Best-Effort-Scheduler“, und seine Beispielkonfigurationen ergänzen, dass Best Effort die Compute-Engine der GPU oft zwei- bis dreifach überbucht, während der Fixed-Share-Scheduler für jede VM eine festgelegte Dienstgüte hält. Best Effort passt zu Büro-Desktops, deren Last kommt und geht, ein fester Anteil je VM zu Nutzern, die zur Spitzenstunde dieselbe Leistung brauchen.

Video-Encoder und Displays für VDI-Streams

NVIDIAs Produktseite zur L4 führt die Karte mit 24 GB und 300 GB/s Speicherbandbreite bei 72 W, in der Bauform „1-Slot Low-Profile“ mit PCIe Gen4 x16. Sie hat zwei NVENC-Encoder, vier NVDEC-Decoder und vier JPEG-Decoder. Für Video nennt die Seite, dass Server mit L4 „bis zu 1.040 gleichzeitige AV1-Videostreams bei 720p30“ hosten, gemessen auf 8 L4 mit einem AV1-Encoding-Preset für niedrige Latenz.

Ein Remote-Display-Protokoll, das auf der GPU kodiert, schickt den Bildschirm jedes Desktops durch diese beiden Encoder. Nach unserer Rechnung legen zwölf Desktops mit L4-2B sechs auf jeden Encoder und vierundzwanzig mit L4-1B zwölf auf jeden. NVIDIAs vPC Sizing Guide nennt die Auslastung von Encoder und Decoder unter den Metriken, die sich mit nvidia-smi überwachen und protokollieren lassen. Eine Session-Grenze je Encoder haben wir in NVIDIAs Sizing-Guides nicht gefunden; die Encoder-Last gehört also neben dem Framebuffer in den Pilot.

Das Profil begrenzt auch die Displays. Die Profile der B-Serie steuern bis zu vier Bildschirme mit 2560×1600 oder weniger, L4-2B und L4-3B zwei mit 3840×2160 und L4-1B einen. L4-2Q und L4-3Q steuern vier mit 3840×2400 oder weniger, ab L4-4Q aufwärts vier Bildschirme mit 5120×2880 oder weniger. Die Profile der A-Serie haben ein einziges Display mit bis zu 1280×1024, das NVIDIAs Lizenzleitfaden nur auf das Konsolendisplay in Umgebungen mit Remote-Anwendungen anwendet.

Welches L4-Profil für Büronutzer und leichtes CAD

Für Wissensarbeiter stellt NVIDIAs vPC Sizing Guide fest, dass moderne Betriebssysteme und sich wandelnde Anwendungs-Workloads „größere Framebuffer erfordern“ und dass „größere Profile (2B oder 3B) oft nötig sind, um ein gleichbleibendes Nutzererlebnis zu erhalten“. Dieser Leitfaden plant Büro-Desktops mit L4-2B und hebt eine Nutzergruppe auf L4-3B an, wenn der Pilot zeigt, dass ihr Framebuffer nahe an der Grenze läuft.

Für CAD setzt die typische Bereitstellung im RTX vWS Guide leichte Nutzer auf ein 4-GB-Profil, DC-4Q auf der RTX PRO 4500 Blackwell, mit 6 bis 8 Nutzern je GPU und je 4 vCPUs und 8 bis 12 GB RAM. Mittlere Nutzer bekommen DC-4Q oder DC-8Q mit 3 bis 6 je GPU, schwere Nutzer DC-12Q bis DC-24Q auf der RTX PRO 6000 Blackwell mit 2 bis 4 je GPU. Auf der L4 entsprechen diesen Framebuffer-Größen L4-4Q und L4-8Q, die 6 und 3 VMs je Karte erlauben. NVIDIAs Nutzerzahlen gelten für Blackwell-Karten mit mehr Rechenleistung als die L4; wie viele CAD-Nutzer eine L4 trägt, zeigt deshalb der Pilot. Von schweren 3D-Nutzern mit 12 oder 24 GB passen einer oder zwei auf eine L4, sie gehören daher auf größere Karten.

NUTZERTYPL4-PROFILLIZENZVMS JE L4GRUNDLAGE
Büro, HD-BildschirmeL4-2BvPC12vPC-Guide: oft 2B oder 3B nötig
Büro, 4K oder intensivL4-3BvPC8mehr Framebuffer je Desktop
Leichtes CAD und 2D-DesignL4-4QvWS64 GB wie für leichte Nutzer im vWS-Guide
Mittleres 3DL4-8QvWS38 GB wie für mittlere Nutzer
Hosts veröffentlichter AppsL4-12A oder L4-24AvApps2 oder 1eine VM bedient viele App-Nutzer
InferenzdienstL4-4C bis L4-24CNVIDIA AI Enterprise6 bis 1Modell und Cache müssen in den Anteil passen

Profile und Maximalwerte aus NVIDIAs Referenzen zu den vGPU-Typen (Tabelle 1); die Zuordnung der Nutzertypen zu L4-Profilen ist unsere Lesart von NVIDIAs vPC-Sizing-Guide und der Beispielkonfigurationen in seinem RTX-vWS-Sizing-Guide (beide aktualisiert am 19. August 2026), im Pilot zu bestätigen.

Wir bauen GPU-Knoten für virtuelle Workstations mit der L4, ausgelegt nach Arbeitsplätzen pro Karte. Beschreiben Sie Ihre Nutzergruppen, deren Bildschirme und Anwendungen im Formular unten, und wir antworten mit dem Profil je Nutzergruppe und den Karten, die es braucht.

Inferenz-VMs auf C-Profilen der L4

Ein Profil der C-Serie auf der L4 ist sinnvoll, wenn ein kleiner Inferenzdienst eine eigene VM braucht, etwa ein Embedding- oder Reranker-Modell für RAG, Spracherkennung oder ein kleines Sprachmodell, getrennt von den Diensten anderer Teams. L4-12C gibt zwei solchen VMs je 12 GB, L4-4C sechs VMs je 4 GB, und die Modellgewichte samt Cache müssen in diesen Anteil passen. Die VMs teilen sich die Rechenleistung der Karte und ihre 300 GB/s Bandbreite in Zeitscheiben; zwei ausgelastete Dienste auf einer L4 laufen also jeder langsamer als einer allein.

Braucht ein Modell die ganze Karte, gibt L4-24C einer VM die vollen 24 GB. NVIDIAs Seite zu den Ada-vGPU-Typen nennt NVIDIA AI Enterprise als erforderliche Lizenz für alle Typen der C-Serie, und unser Artikel zur Lizenzierung von NVIDIA AI Enterprise erklärt, wie sie gezählt wird. NVIDIAs Hinweise für vSphere zum Mischen von Typen nennen nur vGPUs der A-, B- und Q-Serie; wir planen Inferenz-VMs deshalb auf eigenen L4-Karten.

Wie viele L4-Karten in einen VDI-Host passen

Die L4 passt zu dichten VDI-Hosts, weil sie eine Single-Slot-Karte mit 72 W und halber Bauhöhe ist. NVIDIAs vPC Sizing Guide beschreibt sie als „kompakte Single-Slot-GPU für Grafik-, Video- und Inferenz-Workloads“ und führt sie unter den empfohlenen GPUs für vPC, mit der RTX PRO 4500 Blackwell Server Edition als „die primär empfohlene GPU“. Unser Vergleich von L4 und RTX PRO 4500 Server Edition behandelt diese Wahl.

NVIDIAs Tabelle der maximalen Dichte für einen 2U-Server führt die L4 mit 24 Nutzern je Board bei einem 1-GB-Profil, 16 Boards und 384 Nutzern je Server und sagt, die Tabelle „gibt die maximal unterstützte Dichte wieder, nicht einen empfohlenen Einsatzpunkt“. Lenovos Product Guide zur L4 (LP1717, gelesen am 10. Oktober 2026) listet bis zu 8 L4 im ThinkSystem SR650 V3, 10 im SR650 V4 und 8 im SR675 V3. Prüfen Sie die Liste des Herstellers für das genaue Servermodell und den Riser, bevor Sie die Kartenzahl planen.

Rechenbeispiel: ein VDI-Host mit 8 L4

Dieses Beispiel ist unsere Schätzung aus NVIDIAs Maximalwerten, kein Messergebnis. Nehmen Sie einen 2U-Host mit acht L4 für 72 Büronutzer und 12 Nutzer mit leichtem CAD. Sechs Karten laufen mit L4-2B im Modus gleicher Größe, je 12 Desktops, und zwei Karten mit L4-4Q bei ihrem Maximum von je 6 Workstations, eine CAD-Zahl je L4, die der Pilot bestätigen muss, zusammen 84 Sessions auf dem Host. Die Karten ziehen 8 × 72 W = 576 W, vor Prozessoren, Arbeitsspeicher und Lüftern. Die CAD-VMs brauchen 48 vCPUs bei NVIDIAs 4 vCPUs je leichtem Nutzer.

Derselbe Host mit allen acht Karten auf L4-2B nimmt 96 Desktops auf, mit L4-3B 64. Die Lizenzzahl folgt der Spitze, im ersten Layout 72 vPC- und 12 vWS-Nutzer gleichzeitig. Eine ganze Umgebung solcher Hosts mit einem Reservehost für das Failover zu dimensionieren, ist Thema unseres Leitfadens zur VDI-GPU-Dimensionierung.

Wir prüfen Rack, Strom und Luftstrom vor dem Angebot, und die Lizenzen für vGPU und NVIDIA AI Enterprise kommen auf dieselbe Rechnung wie die Karten. Schicken Sie uns Ihre Spitzenzahl an Sessions je Nutzergruppe über das Formular unten.

Hypervisor-Unterstützung und Lizenzen für L4-vGPU

NVIDIAs Support-Matrix für VMware vSphere, aktualisiert am 29. September 2026, listet die L4 für VMware Cloud Foundation 9.1 und 9.0 und für vSphere 8.0, wo das aktuelle Release laut Matrix „VMware vSphere Hypervisor (ESXi) 8.0u3 P06 und spätere Updates von Release 8.0“ voraussetzt, „sofern nicht ausdrücklich anders angegeben“. Dieselbe Matrix verlangt für vGPU die Edition vSphere Foundation von ESXi oder eine Lizenz für vSphere Enterprise Plus. Die Release Notes zu R595 für vSphere (vGPU 20.0 bis 20.2) halten fest: „Sie müssen NVIDIA License System mit jedem Release dieser Release-Familie verwenden“. Unser Artikel zum vGPU-Lizenzserver, DLS oder CLS behandelt diesen Dienst.

vPC, vWS und vApps werden je gleichzeitigem Nutzer lizenziert, was NVIDIAs Leitfaden zu Packaging und Lizenzierung (aktualisiert am 24. März 2026) definiert als „eine Methode zur Zuteilung von Lizenzen auf Grundlage der Anzahl der VMs, die gleichzeitig genutzt werden“. vPC unterstützt bis zu vier Displays mit bis zu 5120×2880, vWS bis zu 7680×4320 mit CUDA und OpenCL und vApps ein Display. Ein L4-Host mit B-, Q- und C-Profilen braucht deshalb vPC- und vWS-Lizenzen je gleichzeitigem Nutzer und NVIDIA AI Enterprise für die Inferenzkarten.

Was wir liefern

Wir liefern die NVIDIA L4 als Karte für Ihre eigenen Server, gelistet auf unserer GPU-Seite, und in auf Bestellung gebauten KI-Servern als VDI-Knoten mit NVIDIA-vGPU-Lizenzierung, ausgelegt nach Arbeitsplätzen pro Karte. Beides kommt mit Herstellergarantie, unter einem EU-Vertrag und auf einer Rechnung. Lizenzen für NVIDIA vPC, RTX vWS und vApps sowie NVIDIA AI Enterprise für Profile der C-Serie kommen über unser Software- und Lizenzangebot auf dieselbe Rechnung. Konfiguration und Angebot erhalten Sie innerhalb eines Werktages, und Rack, Strom und Luftstrom prüfen wir vor dem Angebot.

FAQ

Welche vGPU-Profile unterstützt die NVIDIA L4?
NVIDIA listet Profile der Q-Serie von L4-1Q bis L4-24Q für virtuelle Workstations, der B-Serie von L4-1B bis L4-3B für virtuelle Desktops, der A-Serie für veröffentlichte Anwendungen und der C-Serie von L4-4C bis L4-24C für Compute. Alle laufen per Time-Slicing, weil die L4 kein MIG hat. Die Q-Serie braucht eine vWS-Lizenz, die B-Serie vPC oder vWS, die A-Serie vApps und die C-Serie NVIDIA AI Enterprise.
Wie viele VDI-Nutzer pro L4-GPU?
NVIDIAs Maximum sind 24 Desktops je L4 mit dem 1-GB-Profil L4-1B, 12 mit L4-2B und 8 mit L4-3B im Modus gleicher Größe. Laut NVIDIAs vPC Sizing Guide sind für ein gleichbleibendes Nutzererlebnis oft 2B- oder 3B-Profile nötig; 8 bis 12 Büronutzer je Karte sind also die Planungsspanne, bis ein Pilot sie bestätigt.
Was ist das L4-4Q-Profil?
L4-4Q ist das virtuelle Workstation-Profil der NVIDIA L4 mit 4 GB, mit bis zu 6 VMs je Karte im Modus gleicher Größe und 4 im Modus gemischter Größen. Es braucht eine NVIDIA-RTX-vWS-Lizenz und steuert bis zu vier Displays mit 5120×2880 oder weniger. Es entspricht dem 4-GB-Profil, das NVIDIAs vWS Sizing Guide für leichte CAD-Nutzer verwendet.
Wofür wird das L4-24Q-Profil verwendet?
L4-24Q gibt einer virtuellen Workstation die ganzen 24 GB der L4, für einen 3D- oder CAD-Nutzer, der den gesamten Framebuffer braucht. Es braucht eine vWS-Lizenz, und NVIDIA listet bis zu zwei Displays mit 7680×4320 oder vier mit 5120×2880 oder weniger. Für eine Compute-VM mit der ganzen Karte ist das passende Profil L4-24C unter NVIDIA AI Enterprise.
Wie viele VMs passen maximal auf eine L4 mit vGPU?
Das Maximum sind 24 VMs mit den 1-GB-Profilen L4-1B oder L4-1Q im Modus gleicher Größe und 16 im Modus gemischter Größen. Bei Compute-Profilen liegt das Maximum bei 6 VMs, mit L4-4C, weil die C-Serie kein Profil unter 4 GB hat.
Unterstützt die NVIDIA L4 MIG?
Die L4 unterstützt kein MIG, und NVIDIAs MIG User Guide, aktualisiert am 11. September 2026, führt sie nicht unter den unterstützten GPUs. VMs teilen sich die Karte per time-sliced vGPU, wobei jede VM ihren eigenen Framebuffer hat und die Rechenleistung reihum zugeteilt wird, standardmäßig mit dem Best-Effort-Scheduler.

Schicken Sie uns Ihre Nutzergruppen mit ihrer Spitzenzahl gleichzeitiger Sessions, die Bildschirme und Auflösungen je Nutzer, die Anwendungen, etwaige Inferenzdienste, die auf denselben Hosts geplant sind, und Ihre Hypervisor-Version. Wir antworten innerhalb eines Werktages mit dem L4-Profil je Nutzergruppe, den Karten je Host, den Lizenzeditionen sowie einer Konfiguration und einem Angebot, wobei wir Rack, Strom und Luftstrom vor dem Angebot prüfen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien