NVIDIA L4 vGPU-Profile: die Profilliste, maximale VMs pro GPU und VDI-Nutzer je Karte
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Die NVIDIA L4 hat kein MIG und wird daher nur per time-sliced vGPU geteilt; NVIDIA listet Profile der Q-Serie von 1 GB bis 24 GB, der B-Serie von 1 GB bis 3 GB, der A-Serie ab 24 GB abwärts und der C-Serie von 4 GB bis 24 GB
- Maximale VMs je L4 im Modus gleicher Größe: 24 mit L4-1B oder L4-1Q, 12 mit L4-2B, 8 mit L4-3B, 6 mit L4-4Q oder L4-4C und 1 mit L4-24Q oder L4-24C; im Modus gemischter Größen sinkt das Maximum bei 1 GB auf 16 und bei 2 GB auf 8
- Lizenzeditionen laut NVIDIA: Die Q-Serie braucht vWS, die B-Serie vPC oder vWS, die A-Serie vApps und die C-Serie NVIDIA AI Enterprise; vPC und vWS werden je gleichzeitigem Nutzer gezählt
- Jede L4 hat 2 NVENC-Encoder, 4 NVDEC-Decoder und 4 JPEG-Decoder; 12 Desktops mit L4-2B teilen sich also zwei Encoder, sechs Desktops je Encoder
- NVIDIAs vPC-Dichtetabelle nennt 16 L4 je 2U-Server als Maximum, während Lenovo 8 L4 für den SR650 V3 und 10 für den SR650 V4 listet; acht L4 mit L4-2B nehmen 96 Desktops bei 576 W Kartenleistung auf
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
NVIDIA L4 vGPU-Profile im Überblick
Die NVIDIA L4 wird zwischen virtuellen Maschinen nur per time-sliced vGPU geteilt, denn sie hat kein Multi-Instance GPU (MIG): NVIDIAs MIG User Guide, aktualisiert am 11. September 2026, führt sie nicht unter den unterstützten GPUs. Jedes vGPU-Profil der L4 gibt einer VM einen festen Anteil an den 24 GB Framebuffer der Karte, während die VMs sich ihre Rechenleistung reihum teilen. NVIDIAs vGPU-Dokumentation listet für die L4 vier Serien, Q für virtuelle Workstations, B für virtuelle Desktops, A für veröffentlichte Anwendungen und C für Compute, mit 1 bis 24 VMs je Karte, abhängig von der Größe des Framebuffers.
| PROFIL | FRAMEBUFFER | MAX. JE GPU | MAX. GEMISCHT | LIZENZEDITION |
|---|---|---|---|---|
| L4-24Q | 24 GB | 1 | 1 | vWS |
| L4-12Q | 12 GB | 2 | 2 | vWS |
| L4-8Q | 8 GB | 3 | 2 | vWS |
| L4-6Q | 6 GB | 4 | 4 | vWS |
| L4-4Q | 4 GB | 6 | 4 | vWS |
| L4-3Q | 3 GB | 8 | 8 | vWS |
| L4-2Q | 2 GB | 12 | 8 | vWS |
| L4-1Q | 1 GB | 24 | 16 | vWS |
| L4-3B | 3 GB | 8 | 8 | vPC oder vWS |
| L4-2B | 2 GB | 12 | 8 | vPC oder vWS |
| L4-1B | 1 GB | 24 | 16 | vPC oder vWS |
| L4-24A | 24 GB | 1 | 1 | vApps |
| L4-12A | 12 GB | 2 | 2 | vApps |
| L4-24C | 24 GB | 1 | 1 | NVIDIA AI Enterprise |
| L4-12C | 12 GB | 2 | 2 | NVIDIA AI Enterprise |
| L4-8C | 8 GB | 3 | 2 | NVIDIA AI Enterprise |
| L4-6C | 6 GB | 4 | 4 | NVIDIA AI Enterprise |
| L4-4C | 4 GB | 6 | 4 | NVIDIA AI Enterprise |
NVIDIA Virtual GPU Types Reference im vGPU-Benutzerhandbuch (aktualisiert am 29. September 2026) für die Q- und B-Serie; die Ausgabe vGPU 19.0 derselben Referenz für die A-Serie; NVIDIA AI Enterprise 8.2, Ada Lovelace vGPU types (aktualisiert am 2. September 2026) für die C-Serie. NVIDIA gibt die Größen der Q-, B- und A-Serie in MB an, 1.024 MB je GB.
NVIDIAs Tabelle der A-Serie für die L4 setzt sich unterhalb von L4-12A mit L4-8A fort, drei je Karte; prüfen Sie die kleineren A-Größen in der Referenz, bevor Sie Hosts für veröffentlichte Anwendungen darauf planen. Die C-Serie endet bei 4 GB, die L4 hat also kein Compute-Profil mit 1 GB, 2 GB oder 3 GB. NVIDIAs Fußnote zu den Compute-Typen besagt, dass sie „nur einen einzigen Display-Head“ unterstützen und keine Quadro-Grafikbeschleunigung bieten, und jeder betreibt ein Display mit bis zu 3840×2400. Wie die L4 als Inferenzkarte im Vergleich zur L40S abschneidet, zeigt unser Vergleich von L4 und L40S für Inferenz; dieselbe Referenz für die größere Karte steht in unserem Leitfaden zu den vGPU-Profilen der L40S.
Time-sliced vGPU auf der L4: gleiche und gemischte Größen
NVIDIAs RTX vWS Sizing Guide, aktualisiert am 19. August 2026, hält fest: „Wenn MIG deaktiviert ist, müssen alle auf einer physischen GPU gehosteten vGPUs dieselbe Profilgröße (dieselbe Framebuffer-Größe) haben“. Profile derselben Größe aus verschiedenen Serien dürfen sich eine Karte teilen, etwa 2Q neben 2B in NVIDIAs Beispiel. Eine Karte mit zwölf L4-2B-Desktops kann daher anstelle eines davon eine L4-2Q-Workstation aufnehmen, aber keine L4-4Q.
Heterogene vGPU, die laut NVIDIA „mit vGPU 17.0 eingeführt wurde“, hebt diese Regel auf und lässt eine Karte verschiedene Größen aufnehmen. Das L4-Beispiel des Guides ist eine Karte, die gleichzeitig Instanzen von L4-8Q und L4-2B hostet. Auf vSphere listen NVIDIAs validierte Plattformen gemischte Größen für die L4 auf Release 9.0 sowie auf ESXi 8.0 Update 3 und neuer, was jedes Release in der Support-Matrix von vGPU 20 erfüllt. Im Modus gemischter Größen haben mehrere Größen ein niedrigeres Maximum, das die Spalte für gemischte Größen in der Tabelle zeigt: L4-8Q sinkt von 3 auf 2, L4-4Q und L4-4C von 6 auf 4, die 2-GB-Profile von 12 auf 8 und die 1-GB-Profile von 24 auf 16. Bei einem Host mit mehreren L4-Karten bleiben die höheren Zahlen erhalten, wenn jede Nutzergruppe eigene Karten im Modus gleicher Größe bekommt.
Jede VM behält ihren eigenen Framebuffer, während die Rechenleistung in Zeitscheiben geteilt wird. Laut vWS-Guide „verwendet“ die vGPU-Software „standardmäßig den Best-Effort-Scheduler“, und seine Beispielkonfigurationen ergänzen, dass Best Effort die Compute-Engine der GPU oft zwei- bis dreifach überbucht, während der Fixed-Share-Scheduler für jede VM eine festgelegte Dienstgüte hält. Best Effort passt zu Büro-Desktops, deren Last kommt und geht, ein fester Anteil je VM zu Nutzern, die zur Spitzenstunde dieselbe Leistung brauchen.
Video-Encoder und Displays für VDI-Streams
NVIDIAs Produktseite zur L4 führt die Karte mit 24 GB und 300 GB/s Speicherbandbreite bei 72 W, in der Bauform „1-Slot Low-Profile“ mit PCIe Gen4 x16. Sie hat zwei NVENC-Encoder, vier NVDEC-Decoder und vier JPEG-Decoder. Für Video nennt die Seite, dass Server mit L4 „bis zu 1.040 gleichzeitige AV1-Videostreams bei 720p30“ hosten, gemessen auf 8 L4 mit einem AV1-Encoding-Preset für niedrige Latenz.
Ein Remote-Display-Protokoll, das auf der GPU kodiert, schickt den Bildschirm jedes Desktops durch diese beiden Encoder. Nach unserer Rechnung legen zwölf Desktops mit L4-2B sechs auf jeden Encoder und vierundzwanzig mit L4-1B zwölf auf jeden. NVIDIAs vPC Sizing Guide nennt die Auslastung von Encoder und Decoder unter den Metriken, die sich mit nvidia-smi überwachen und protokollieren lassen. Eine Session-Grenze je Encoder haben wir in NVIDIAs Sizing-Guides nicht gefunden; die Encoder-Last gehört also neben dem Framebuffer in den Pilot.
Das Profil begrenzt auch die Displays. Die Profile der B-Serie steuern bis zu vier Bildschirme mit 2560×1600 oder weniger, L4-2B und L4-3B zwei mit 3840×2160 und L4-1B einen. L4-2Q und L4-3Q steuern vier mit 3840×2400 oder weniger, ab L4-4Q aufwärts vier Bildschirme mit 5120×2880 oder weniger. Die Profile der A-Serie haben ein einziges Display mit bis zu 1280×1024, das NVIDIAs Lizenzleitfaden nur auf das Konsolendisplay in Umgebungen mit Remote-Anwendungen anwendet.
Welches L4-Profil für Büronutzer und leichtes CAD
Für Wissensarbeiter stellt NVIDIAs vPC Sizing Guide fest, dass moderne Betriebssysteme und sich wandelnde Anwendungs-Workloads „größere Framebuffer erfordern“ und dass „größere Profile (2B oder 3B) oft nötig sind, um ein gleichbleibendes Nutzererlebnis zu erhalten“. Dieser Leitfaden plant Büro-Desktops mit L4-2B und hebt eine Nutzergruppe auf L4-3B an, wenn der Pilot zeigt, dass ihr Framebuffer nahe an der Grenze läuft.
Für CAD setzt die typische Bereitstellung im RTX vWS Guide leichte Nutzer auf ein 4-GB-Profil, DC-4Q auf der RTX PRO 4500 Blackwell, mit 6 bis 8 Nutzern je GPU und je 4 vCPUs und 8 bis 12 GB RAM. Mittlere Nutzer bekommen DC-4Q oder DC-8Q mit 3 bis 6 je GPU, schwere Nutzer DC-12Q bis DC-24Q auf der RTX PRO 6000 Blackwell mit 2 bis 4 je GPU. Auf der L4 entsprechen diesen Framebuffer-Größen L4-4Q und L4-8Q, die 6 und 3 VMs je Karte erlauben. NVIDIAs Nutzerzahlen gelten für Blackwell-Karten mit mehr Rechenleistung als die L4; wie viele CAD-Nutzer eine L4 trägt, zeigt deshalb der Pilot. Von schweren 3D-Nutzern mit 12 oder 24 GB passen einer oder zwei auf eine L4, sie gehören daher auf größere Karten.
| NUTZERTYP | L4-PROFIL | LIZENZ | VMS JE L4 | GRUNDLAGE |
|---|---|---|---|---|
| Büro, HD-Bildschirme | L4-2B | vPC | 12 | vPC-Guide: oft 2B oder 3B nötig |
| Büro, 4K oder intensiv | L4-3B | vPC | 8 | mehr Framebuffer je Desktop |
| Leichtes CAD und 2D-Design | L4-4Q | vWS | 6 | 4 GB wie für leichte Nutzer im vWS-Guide |
| Mittleres 3D | L4-8Q | vWS | 3 | 8 GB wie für mittlere Nutzer |
| Hosts veröffentlichter Apps | L4-12A oder L4-24A | vApps | 2 oder 1 | eine VM bedient viele App-Nutzer |
| Inferenzdienst | L4-4C bis L4-24C | NVIDIA AI Enterprise | 6 bis 1 | Modell und Cache müssen in den Anteil passen |
Profile und Maximalwerte aus NVIDIAs Referenzen zu den vGPU-Typen (Tabelle 1); die Zuordnung der Nutzertypen zu L4-Profilen ist unsere Lesart von NVIDIAs vPC-Sizing-Guide und der Beispielkonfigurationen in seinem RTX-vWS-Sizing-Guide (beide aktualisiert am 19. August 2026), im Pilot zu bestätigen.
Wir bauen GPU-Knoten für virtuelle Workstations mit der L4, ausgelegt nach Arbeitsplätzen pro Karte. Beschreiben Sie Ihre Nutzergruppen, deren Bildschirme und Anwendungen im Formular unten, und wir antworten mit dem Profil je Nutzergruppe und den Karten, die es braucht.
Inferenz-VMs auf C-Profilen der L4
Ein Profil der C-Serie auf der L4 ist sinnvoll, wenn ein kleiner Inferenzdienst eine eigene VM braucht, etwa ein Embedding- oder Reranker-Modell für RAG, Spracherkennung oder ein kleines Sprachmodell, getrennt von den Diensten anderer Teams. L4-12C gibt zwei solchen VMs je 12 GB, L4-4C sechs VMs je 4 GB, und die Modellgewichte samt Cache müssen in diesen Anteil passen. Die VMs teilen sich die Rechenleistung der Karte und ihre 300 GB/s Bandbreite in Zeitscheiben; zwei ausgelastete Dienste auf einer L4 laufen also jeder langsamer als einer allein.
Braucht ein Modell die ganze Karte, gibt L4-24C einer VM die vollen 24 GB. NVIDIAs Seite zu den Ada-vGPU-Typen nennt NVIDIA AI Enterprise als erforderliche Lizenz für alle Typen der C-Serie, und unser Artikel zur Lizenzierung von NVIDIA AI Enterprise erklärt, wie sie gezählt wird. NVIDIAs Hinweise für vSphere zum Mischen von Typen nennen nur vGPUs der A-, B- und Q-Serie; wir planen Inferenz-VMs deshalb auf eigenen L4-Karten.
Wie viele L4-Karten in einen VDI-Host passen
Die L4 passt zu dichten VDI-Hosts, weil sie eine Single-Slot-Karte mit 72 W und halber Bauhöhe ist. NVIDIAs vPC Sizing Guide beschreibt sie als „kompakte Single-Slot-GPU für Grafik-, Video- und Inferenz-Workloads“ und führt sie unter den empfohlenen GPUs für vPC, mit der RTX PRO 4500 Blackwell Server Edition als „die primär empfohlene GPU“. Unser Vergleich von L4 und RTX PRO 4500 Server Edition behandelt diese Wahl.
NVIDIAs Tabelle der maximalen Dichte für einen 2U-Server führt die L4 mit 24 Nutzern je Board bei einem 1-GB-Profil, 16 Boards und 384 Nutzern je Server und sagt, die Tabelle „gibt die maximal unterstützte Dichte wieder, nicht einen empfohlenen Einsatzpunkt“. Lenovos Product Guide zur L4 (LP1717, gelesen am 10. Oktober 2026) listet bis zu 8 L4 im ThinkSystem SR650 V3, 10 im SR650 V4 und 8 im SR675 V3. Prüfen Sie die Liste des Herstellers für das genaue Servermodell und den Riser, bevor Sie die Kartenzahl planen.
Rechenbeispiel: ein VDI-Host mit 8 L4
Dieses Beispiel ist unsere Schätzung aus NVIDIAs Maximalwerten, kein Messergebnis. Nehmen Sie einen 2U-Host mit acht L4 für 72 Büronutzer und 12 Nutzer mit leichtem CAD. Sechs Karten laufen mit L4-2B im Modus gleicher Größe, je 12 Desktops, und zwei Karten mit L4-4Q bei ihrem Maximum von je 6 Workstations, eine CAD-Zahl je L4, die der Pilot bestätigen muss, zusammen 84 Sessions auf dem Host. Die Karten ziehen 8 × 72 W = 576 W, vor Prozessoren, Arbeitsspeicher und Lüftern. Die CAD-VMs brauchen 48 vCPUs bei NVIDIAs 4 vCPUs je leichtem Nutzer.
Derselbe Host mit allen acht Karten auf L4-2B nimmt 96 Desktops auf, mit L4-3B 64. Die Lizenzzahl folgt der Spitze, im ersten Layout 72 vPC- und 12 vWS-Nutzer gleichzeitig. Eine ganze Umgebung solcher Hosts mit einem Reservehost für das Failover zu dimensionieren, ist Thema unseres Leitfadens zur VDI-GPU-Dimensionierung.
Wir prüfen Rack, Strom und Luftstrom vor dem Angebot, und die Lizenzen für vGPU und NVIDIA AI Enterprise kommen auf dieselbe Rechnung wie die Karten. Schicken Sie uns Ihre Spitzenzahl an Sessions je Nutzergruppe über das Formular unten.
Hypervisor-Unterstützung und Lizenzen für L4-vGPU
NVIDIAs Support-Matrix für VMware vSphere, aktualisiert am 29. September 2026, listet die L4 für VMware Cloud Foundation 9.1 und 9.0 und für vSphere 8.0, wo das aktuelle Release laut Matrix „VMware vSphere Hypervisor (ESXi) 8.0u3 P06 und spätere Updates von Release 8.0“ voraussetzt, „sofern nicht ausdrücklich anders angegeben“. Dieselbe Matrix verlangt für vGPU die Edition vSphere Foundation von ESXi oder eine Lizenz für vSphere Enterprise Plus. Die Release Notes zu R595 für vSphere (vGPU 20.0 bis 20.2) halten fest: „Sie müssen NVIDIA License System mit jedem Release dieser Release-Familie verwenden“. Unser Artikel zum vGPU-Lizenzserver, DLS oder CLS behandelt diesen Dienst.
vPC, vWS und vApps werden je gleichzeitigem Nutzer lizenziert, was NVIDIAs Leitfaden zu Packaging und Lizenzierung (aktualisiert am 24. März 2026) definiert als „eine Methode zur Zuteilung von Lizenzen auf Grundlage der Anzahl der VMs, die gleichzeitig genutzt werden“. vPC unterstützt bis zu vier Displays mit bis zu 5120×2880, vWS bis zu 7680×4320 mit CUDA und OpenCL und vApps ein Display. Ein L4-Host mit B-, Q- und C-Profilen braucht deshalb vPC- und vWS-Lizenzen je gleichzeitigem Nutzer und NVIDIA AI Enterprise für die Inferenzkarten.
Was wir liefern
Wir liefern die NVIDIA L4 als Karte für Ihre eigenen Server, gelistet auf unserer GPU-Seite, und in auf Bestellung gebauten KI-Servern als VDI-Knoten mit NVIDIA-vGPU-Lizenzierung, ausgelegt nach Arbeitsplätzen pro Karte. Beides kommt mit Herstellergarantie, unter einem EU-Vertrag und auf einer Rechnung. Lizenzen für NVIDIA vPC, RTX vWS und vApps sowie NVIDIA AI Enterprise für Profile der C-Serie kommen über unser Software- und Lizenzangebot auf dieselbe Rechnung. Konfiguration und Angebot erhalten Sie innerhalb eines Werktages, und Rack, Strom und Luftstrom prüfen wir vor dem Angebot.
FAQ
Welche vGPU-Profile unterstützt die NVIDIA L4?
Wie viele VDI-Nutzer pro L4-GPU?
Was ist das L4-4Q-Profil?
Wofür wird das L4-24Q-Profil verwendet?
Wie viele VMs passen maximal auf eine L4 mit vGPU?
Unterstützt die NVIDIA L4 MIG?
Schicken Sie uns Ihre Nutzergruppen mit ihrer Spitzenzahl gleichzeitiger Sessions, die Bildschirme und Auflösungen je Nutzer, die Anwendungen, etwaige Inferenzdienste, die auf denselben Hosts geplant sind, und Ihre Hypervisor-Version. Wir antworten innerhalb eines Werktages mit dem L4-Profil je Nutzergruppe, den Karten je Host, den Lizenzeditionen sowie einer Konfiguration und einem Angebot, wobei wir Rack, Strom und Luftstrom vor dem Angebot prüfen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages