BLOG · VERGLEICH · · AKTUALISIERT

L4 vs. L40S: welche Inferenzkarte für die Server, die Sie bereits haben

IN KÜRZE
  • Beide sind passiv gekühlte Ada-Lovelace-Karten fürs Rechenzentrum, unterstützen FP8 und vGPU und haben weder MIG noch NVLink; die L4 ist eine Single-Slot-Karte mit halber Bauhöhe und 72 W, die L40S eine Dual-Slot-Karte in voller Größe mit 350 W
  • Die L40S hat doppelt so viel Speicher (48 GB), die 2,9-fache Bandbreite (864 GB/s) und die dreifache FP8-Rate ohne Sparsity (733 TFLOPS)
  • Bei der Objekterkennung in MLPerf Inference v5.1 (RetinaNet, Closed Division, Offline-Szenario; Einträge 5.1-0018 und 5.1-0012) ergibt unsere Rechnung, Systemergebnis geteilt durch die Zahl der GPUs, keine MLPerf-Metrik, etwa 229 Bilder pro Sekunde je L4 und 815 je L40S, das 3,6-Fache; die Leistungsaufnahme wurde bei diesen Läufen nicht gemessen
  • Im selben 4U-Server kommen sechzehn L4 und acht L40S jeweils auf 384 GB, bei 1.152 W gegenüber 2.800 W Leistungsaufnahme der GPUs
  • Wir haben für keine der beiden Karten eine End-of-Life-Mitteilung von NVIDIA gefunden: NVIDIA führt beide auf der eigenen vGPU-Lifecycle-Seite vom August 2026 als voll unterstützt und positioniert die Server Editions der RTX PRO 4500 und der RTX PRO 6000 als ihre Blackwell-Nachfolger

Zwei Ada-Karten für zwei verschiedene Aufgaben

NVIDIA hat die L4 im März 2023 als sparsame Karte für Inferenz und Video vorgestellt, als Nachfolgerin der T4, und die L40S später im selben Jahr als seine „universelle“ Rechenzentrums-GPU für Inferenz, Training, Grafik und Video. Beide nutzen die Ada-Lovelace-Architektur mit FP8-Tensor-Kernen, beide sind passiv gekühlt und auf die Lüfter des Servers angewiesen, beide unterstützen Secure Boot mit einem Hardware-Root-of-Trust, und beide stehen auf NVIDIAs vGPU-Liste. Keine der beiden unterstützt MIG oder NVLink. Was sie trennt, ist die Größenordnung: Die eine zieht 72 W aus dem Steckplatz, im Single-Slot-Format mit halber Bauhöhe, die andere bis zu 350 W, mit einem 16-poligen Zusatzstecker, als Dual-Slot-Karte in voller Größe.

Die Spezifikationstabelle

SPEZIFIKATIONNVIDIA L4NVIDIA L40S
CUDA-Kerne7.42418.176
Speicher24 GB GDDR6 mit ECC48 GB GDDR6 mit ECC
Bandbreite300 GB/s864 GB/s
FP3230,3 TFLOPS91,6 TFLOPS
FP8, ohne/mit Sparsity242,5 und 485 TFLOPS733 und 1.466 TFLOPS
FP16/BF16, ohne/mit Sparsity121 und 242 TFLOPS362 und 733 TFLOPS
Maximale Leistung72 W, bis auf 40 W konfigurierbar350 W
Stromanschlusskeiner, Versorgung über den Steckplatzein 16-poliger
Bauformhalbe Bauhöhe, Single Slotvolle Bauhöhe, volle Länge, Dual Slot
Video-Engines2 NVENC, 4 NVDEC, 4 JPEG-Decoder3 NVENC, 3 NVDEC
Displayausgängekeine4× DisplayPort 1.4a, standardmäßig deaktiviert
SchnittstellePCIe 4.0 x16PCIe 4.0 x16
MIGneinnein
vGPUja, ab vGPU 15.2ja, ab vGPU 16.1

Produktseiten, Datenblätter und Product Briefs von NVIDIA zu L4 und L40S, NVIDIAs Whitepaper zur Ada-Architektur und Lenovos Product Guide zur L4; NVIDIAs Liste der von vGPU unterstützten GPUs. NVIDIAs Werte mit Sparsity setzen strukturierte Sparsity voraus; die Werte ohne Sparsity liegen bei etwa der Hälfte.

MLPerf®-Ergebnisse, je Karte umgerechnet

MLPerf Inference v5.1, veröffentlicht im September 2025, enthält einen Benchmark, in dem beide Karten und die H200 NVL in derselben Runde und Division getestet wurden: Objekterkennung mit RetinaNet in der Kategorie Datacenter der Closed Division, Offline-Szenario, wobei alle Systeme TensorRT nutzten.

SYSTEMEINTRAGGPUSBILDER PRO SEKUNDEJE KARTE
Dell PowerEdge R4705.1-00182 × L4458,5229,3
Dell PowerEdge R5705.1-00194 × L4905,5226,4
Cisco UCS C845A M85.1-00128 × L40S6.518,4814,8
System mit acht H200 NVL5.1-00058 × H200 NVL13.319,51.664,9

MLPerf Inference v5.1, Kategorie Datacenter, Closed Division, RetinaNet, Offline-Szenario; Einträge wie angegeben, abgerufen von mlcommons.org am 24. September 2026, jedes Ergebnis von der MLCommons Association verifiziert. Je Karte ist unsere Rechnung: Systemergebnis geteilt durch die Zahl der GPUs, keine MLPerf-Metrik. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information.

Je Karte leistet die L40S im System mit acht Karten nach unserer Rechnung etwa das 3,6-Fache einer L4 im System mit zwei Karten, in derselben Runde, Division und im selben Szenario. Diese Läufe gehörten nicht zur MLPerf-Power-Kategorie und haben keine Leistungsaufnahme gemessen; sie zeigen also nicht, welche Karte je Watt mehr leistet.

Veröffentlichte Ergebnisse mit Sprachmodellen gibt es für die L40S. In MLPerf Inference v5.0, veröffentlicht im April 2025, verarbeitete ein Dell PowerEdge XE7745 mit acht L40S (Eintrag 5.0-0018) mit Llama 2 70B (Variante mit 99 Prozent Genauigkeit) im Offline-Szenario 3.481,5 Token pro Sekunde, etwa 435 je Karte; dasselbe Servermodell mit acht H200 NVL (Eintrag 5.0-0017) erreichte in derselben Runde, Division und im selben Szenario 31.149,9, etwa 3.890 je Karte. Beide sind Ergebnisse der Kategorie Datacenter in der Closed Division, abgerufen von mlcommons.org am 24. September 2026, jedes Ergebnis von der MLCommons Association verifiziert; je Karte ist unsere Rechnung: Systemergebnis geteilt durch die Zahl der GPUs, keine MLPerf-Metrik. In den Datacenter-Ergebnissen der letzten Runden haben wir für die L4 kein vergleichbares veröffentlichtes Ergebnis mit einem Sprachmodell gefunden.

Der Speicher entscheidet über das Modell

Auf eine L4 mit 24 GB passt ein 8B-Modell in FP8, gpt-oss-20b mit 13,8 GB oder ein 14B-Modell in FP8 mit einem bescheidenen Cache. Auf eine L40S mit 48 GB passt ein 32B-Modell in FP8 mit Platz für Nutzer oder ein 70B-Modell in 4 Bit mit sehr wenig Platz. Keine der beiden Karten fasst gpt-oss-120b allein, und keine hat FP4-Arithmetik: Ada führt 4-Bit-Gewichte als INT4 über AWQ oder GPTQ aus, was TensorRT-LLM auf beiden Karten unterstützt, aber kein NVFP4. Die Bandbreite bestimmt dann das Tempo: Beim selben Modell kann die Token-Generierung für einen einzelnen Nutzer auf einer L40S bis zu etwa 2,9-mal so schnell laufen wie auf einer L4, im Verhältnis ihrer Bandbreiten; das ist eine Obergrenze aus den Spezifikationen, keine Messung.

Braucht das Modell mehr als 48 GB, ist keine der beiden Karten die Antwort. Die RTX PRO 6000 Server Edition mit 96 GB und die H200 NVL mit 141 GB sind die nächsten Stufen, und unser VRAM-Leitfaden hat die Rechnung.

Video, Grafik und virtuelle Desktops

Bei Video ist die L4 darauf ausgelegt, vorn zu liegen. Sie hat zwei Encoder, vier Decoder und vier JPEG-Decoder gegenüber drei und drei bei der L40S, und beide kodieren AV1. NVIDIA nennt bis zu 1.040 gleichzeitige AV1-Streams mit 720p30 für einen Server mit acht L4, etwa 130 je Karte, und die 120-fache KI-Videoleistung eines CPU-Servers mit zwei Sockeln in einer End-to-End-Pipeline; beide Werte stammen von Servern mit acht Karten, und nur der zweite ist ein Vergleich mit einem reinen CPU-Server. Für Videoanalyse, Transcoding und Kamerastreams ist die Zahl der Engines je Watt bei der L4 schwer zu schlagen.

Bei Grafik ist es umgekehrt. Die L40S hat 142 RT-Kerne und Displayausgänge, die sich einschalten lassen, und NVIDIA positioniert sie für Grafik und Video ebenso wie für KI. Für virtuelle Desktops eignen sich beide: Die L40S unterstützt bis zu 32 Nutzer je Karte mit 1-GB-Profilen, die L4 bis zu 24 mit 1-GB-Profilen, und beide brauchen NVIDIA-vGPU-Lizenzen.

Dichte und Leistungsaufnahme je Server

SERVERHÖHEL4 MAXIMALL40S MAXIMAL
HPE ProLiant DL380a Gen112U84
Lenovo ThinkSystem SR650 V32U83
Lenovo ThinkSystem SR675 V33U88
HPE ProLiant Compute DL380a Gen124U1610
Dell PowerEdge XE77454U168

Produktseiten und Product Guides von HPE, Dell und Lenovo; Höchstzahlen nach Angabe der Hersteller, September 2026.

Daraus folgt die Rechnung fürs Rack. Acht L4 ziehen 576 W und sechzehn 1.152 W; vier L40S ziehen 1.400 W und acht 2.800 W, jeweils ohne Prozessoren und Lüfter. Im selben Dell PowerEdge XE7745 kommen sechzehn L4 und acht L40S jeweils auf 384 GB GPU-Speicher; die Bestückung mit L40S hat 6.912 GB/s Gesamtbandbreite gegenüber 4.800 GB/s und zieht etwa das 2,4-Fache an Leistung. Sechzehn kleine Karten passen zu vielen kleinen Modellen oder vielen Streams; acht große zu weniger, größeren Modellen. Was das für den Raum bedeutet, behandelt unser Artikel zu Strom und Kühlung im Rack.

Wann welche Karte

Die L4 passt, wenn die Arbeit aus vielen kleinen Modellen oder vielen Streams besteht: Videoanalyse, Transcoding, Sprache, Embeddings, Modelle mit 7B bis 14B und virtuelle Desktops für Nutzer mit geringen Anforderungen. Sie ist auch die Karte für Server ohne GPU-Stromkabel, sofern der Serverhersteller die L4 für dieses Gehäuse und diesen Steckplatz listet (die Karte ist passiv gekühlt und auf den Luftstrom des Servers angewiesen), und für Racks, in denen jedes Watt zählt.

Die L40S passt, wenn ein Modell 24 bis 48 GB braucht, wenn der Durchsatz je Karte mehr zählt als je Watt und wenn dieselben Server auch Grafik oder Rendering übernehmen.

Keine der beiden passt zu einem 70B-Modell für ein Team oder zu etwas Größerem: Das ist das Revier der RTX PRO 6000 oder der H200 NVL.

Lebenszyklus und was danach kommt

Wir haben für keine der beiden Karten eine End-of-Life-Mitteilung von NVIDIA gefunden, und NVIDIAs vGPU-Lifecycle-Seite vom 3. August 2026 führt die L4 und die L40S unter den GPUs, die „weiterhin voll unterstützt“ werden. Diese Seite betrifft den Support der vGPU-Software, nicht die Frage, wie lange die Karten bestellbar bleiben. NVIDIA positioniert zwei Blackwell-Karten als ihre Nachfolger. Der L40S stellt NVIDIA die RTX PRO 6000 Blackwell Server Edition gegenüber, mit „bis zu 5-mal höherem Inferenzdurchsatz bei großen Sprachmodellen (LLM)“. Der L4 stellt NVIDIA die RTX PRO 4500 Blackwell Server Edition gegenüber, eine Single-Slot-Karte mit voller Bauhöhe, 165 W, 32 GB und 800 GB/s, die laut NVIDIA „mehr als die 5-fache Leistung der L4-GPU der vorherigen Generation“ liefert. Zu keiner der beiden Aussagen sind Testbedingungen veröffentlicht, und die RTX PRO 4500 ist keine Karte mit halber Bauhöhe, sie passt also nicht dorthin, wo eine L4 passt.

Was wir liefern

Eurokommerz liefert die NVIDIA L4 und die L40S EU-weit mit Herstellergarantie, als Karten oder in nach Auftrag gebauten Servern, und die RTX PRO 6000 Server Edition, wenn ein Modell ihnen entwächst. Schicken Sie uns die Arbeitslast und die Server, die Sie betreiben, und wir sagen Ihnen, welche Karte passt und wie viele davon das Rack mit Strom versorgen kann.

FAQ

Wie viel schneller ist die L40S als die L4?
Je Karte etwa 3,6-mal so schnell bei der Objekterkennung in MLPerf Inference v5.1 (RetinaNet, Closed Division, Offline-Szenario): 815 gegenüber 229 Bildern pro Sekunde, nach unserer Rechnung aus einem Ergebnis mit acht L40S (Eintrag 5.1-0012) und einem mit zwei L4 (Eintrag 5.1-0018), geteilt durch die Zahl der GPUs, keine MLPerf-Metrik. Bei Sprachmodellen setzt ihre 2,9-mal höhere Bandbreite die Obergrenze für die Token-Generierung.
Welche ist effizienter, die L4 oder die L40S?
Die Ergebnisse von MLPerf Inference v5.1 zur Objekterkennung sagen es nicht: Diese Läufe haben keine Leistungsaufnahme gemessen. Nach Nennleistung ziehen sechzehn L4 in einem Server 1.152 W und acht L40S 2.800 W, für dieselben 384 GB GPU-Speicher.
Kann die L4 ein 70B-Modell ausführen?
Nein. Ihre 24 GB fassen Modelle bis etwa 14B in FP8. Ein 70B-Modell in 4 Bit braucht mindestens eine L40S, mit wenig Platz für Nutzer, und um ein Team zu bedienen, braucht es eine RTX PRO 6000 oder eine H200 NVL.
Unterstützen die L4 und die L40S MIG?
Nein. Beide werden per Time-Sliced vGPU geteilt: bis zu 24 Nutzer je L4 und 32 je L40S mit 1-GB-Profilen, mit NVIDIA-vGPU-Lizenzen.
Wie viele L4 passen in einen 2U-Server?
Die Hersteller nennen bis zu acht im HPE ProLiant DL380a Gen11 und im Lenovo SR650 V3 und bis zu zehn im Lenovo SR650 V4; Dell gibt für den PowerEdge R760xa zwölf einfach breite Steckplätze mit 75 W an, ohne die L4 zu nennen.
Sind die L4 und die L40S abgekündigt?
Wir haben für keine der beiden eine End-of-Life-Mitteilung von NVIDIA gefunden. NVIDIAs vGPU-Lifecycle-Seite vom August 2026 führt beide als voll unterstützt.

Nennen Sie uns die Modelle oder Streams, die Sie bedienen müssen, die Server, die Sie haben, und die verfügbare Leistung je Rack. Wir sagen Ihnen, welche Karte passt und wie viele davon. Wir antworten innerhalb eines Werktages.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at  ·  +43 1 585 1405 50  ·  Jordangasse 7, 1010 Wien