L4 vs. L40S: welche Inferenzkarte für die Server, die Sie bereits haben
- Beide sind passiv gekühlte Ada-Lovelace-Karten fürs Rechenzentrum, unterstützen FP8 und vGPU und haben weder MIG noch NVLink; die L4 ist eine Single-Slot-Karte mit halber Bauhöhe und 72 W, die L40S eine Dual-Slot-Karte in voller Größe mit 350 W
- Die L40S hat doppelt so viel Speicher (48 GB), die 2,9-fache Bandbreite (864 GB/s) und die dreifache FP8-Rate ohne Sparsity (733 TFLOPS)
- Bei der Objekterkennung in MLPerf Inference v5.1 (RetinaNet, Closed Division, Offline-Szenario; Einträge
5.1-0018und5.1-0012) ergibt unsere Rechnung, Systemergebnis geteilt durch die Zahl der GPUs, keine MLPerf-Metrik, etwa 229 Bilder pro Sekunde je L4 und 815 je L40S, das 3,6-Fache; die Leistungsaufnahme wurde bei diesen Läufen nicht gemessen - Im selben 4U-Server kommen sechzehn L4 und acht L40S jeweils auf 384 GB, bei 1.152 W gegenüber 2.800 W Leistungsaufnahme der GPUs
- Wir haben für keine der beiden Karten eine End-of-Life-Mitteilung von NVIDIA gefunden: NVIDIA führt beide auf der eigenen vGPU-Lifecycle-Seite vom August 2026 als voll unterstützt und positioniert die Server Editions der RTX PRO 4500 und der RTX PRO 6000 als ihre Blackwell-Nachfolger
Zwei Ada-Karten für zwei verschiedene Aufgaben
NVIDIA hat die L4 im März 2023 als sparsame Karte für Inferenz und Video vorgestellt, als Nachfolgerin der T4, und die L40S später im selben Jahr als seine „universelle“ Rechenzentrums-GPU für Inferenz, Training, Grafik und Video. Beide nutzen die Ada-Lovelace-Architektur mit FP8-Tensor-Kernen, beide sind passiv gekühlt und auf die Lüfter des Servers angewiesen, beide unterstützen Secure Boot mit einem Hardware-Root-of-Trust, und beide stehen auf NVIDIAs vGPU-Liste. Keine der beiden unterstützt MIG oder NVLink. Was sie trennt, ist die Größenordnung: Die eine zieht 72 W aus dem Steckplatz, im Single-Slot-Format mit halber Bauhöhe, die andere bis zu 350 W, mit einem 16-poligen Zusatzstecker, als Dual-Slot-Karte in voller Größe.
Die Spezifikationstabelle
| SPEZIFIKATION | NVIDIA L4 | NVIDIA L40S |
|---|---|---|
| CUDA-Kerne | 7.424 | 18.176 |
| Speicher | 24 GB GDDR6 mit ECC | 48 GB GDDR6 mit ECC |
| Bandbreite | 300 GB/s | 864 GB/s |
| FP32 | 30,3 TFLOPS | 91,6 TFLOPS |
| FP8, ohne/mit Sparsity | 242,5 und 485 TFLOPS | 733 und 1.466 TFLOPS |
| FP16/BF16, ohne/mit Sparsity | 121 und 242 TFLOPS | 362 und 733 TFLOPS |
| Maximale Leistung | 72 W, bis auf 40 W konfigurierbar | 350 W |
| Stromanschluss | keiner, Versorgung über den Steckplatz | ein 16-poliger |
| Bauform | halbe Bauhöhe, Single Slot | volle Bauhöhe, volle Länge, Dual Slot |
| Video-Engines | 2 NVENC, 4 NVDEC, 4 JPEG-Decoder | 3 NVENC, 3 NVDEC |
| Displayausgänge | keine | 4× DisplayPort 1.4a, standardmäßig deaktiviert |
| Schnittstelle | PCIe 4.0 x16 | PCIe 4.0 x16 |
| MIG | nein | nein |
| vGPU | ja, ab vGPU 15.2 | ja, ab vGPU 16.1 |
Produktseiten, Datenblätter und Product Briefs von NVIDIA zu L4 und L40S, NVIDIAs Whitepaper zur Ada-Architektur und Lenovos Product Guide zur L4; NVIDIAs Liste der von vGPU unterstützten GPUs. NVIDIAs Werte mit Sparsity setzen strukturierte Sparsity voraus; die Werte ohne Sparsity liegen bei etwa der Hälfte.
MLPerf®-Ergebnisse, je Karte umgerechnet
MLPerf Inference v5.1, veröffentlicht im September 2025, enthält einen Benchmark, in dem beide Karten und die H200 NVL in derselben Runde und Division getestet wurden: Objekterkennung mit RetinaNet in der Kategorie Datacenter der Closed Division, Offline-Szenario, wobei alle Systeme TensorRT nutzten.
| SYSTEM | EINTRAG | GPUS | BILDER PRO SEKUNDE | JE KARTE |
|---|---|---|---|---|
| Dell PowerEdge R470 | 5.1-0018 | 2 × L4 | 458,5 | 229,3 |
| Dell PowerEdge R570 | 5.1-0019 | 4 × L4 | 905,5 | 226,4 |
| Cisco UCS C845A M8 | 5.1-0012 | 8 × L40S | 6.518,4 | 814,8 |
| System mit acht H200 NVL | 5.1-0005 | 8 × H200 NVL | 13.319,5 | 1.664,9 |
MLPerf Inference v5.1, Kategorie Datacenter, Closed Division, RetinaNet, Offline-Szenario; Einträge wie angegeben, abgerufen von mlcommons.org am 24. September 2026, jedes Ergebnis von der MLCommons Association verifiziert. Je Karte ist unsere Rechnung: Systemergebnis geteilt durch die Zahl der GPUs, keine MLPerf-Metrik. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information.
Je Karte leistet die L40S im System mit acht Karten nach unserer Rechnung etwa das 3,6-Fache einer L4 im System mit zwei Karten, in derselben Runde, Division und im selben Szenario. Diese Läufe gehörten nicht zur MLPerf-Power-Kategorie und haben keine Leistungsaufnahme gemessen; sie zeigen also nicht, welche Karte je Watt mehr leistet.
Veröffentlichte Ergebnisse mit Sprachmodellen gibt es für die L40S. In MLPerf Inference v5.0, veröffentlicht im April 2025, verarbeitete ein Dell PowerEdge XE7745 mit acht L40S (Eintrag 5.0-0018) mit Llama 2 70B (Variante mit 99 Prozent Genauigkeit) im Offline-Szenario 3.481,5 Token pro Sekunde, etwa 435 je Karte; dasselbe Servermodell mit acht H200 NVL (Eintrag 5.0-0017) erreichte in derselben Runde, Division und im selben Szenario 31.149,9, etwa 3.890 je Karte. Beide sind Ergebnisse der Kategorie Datacenter in der Closed Division, abgerufen von mlcommons.org am 24. September 2026, jedes Ergebnis von der MLCommons Association verifiziert; je Karte ist unsere Rechnung: Systemergebnis geteilt durch die Zahl der GPUs, keine MLPerf-Metrik. In den Datacenter-Ergebnissen der letzten Runden haben wir für die L4 kein vergleichbares veröffentlichtes Ergebnis mit einem Sprachmodell gefunden.
Der Speicher entscheidet über das Modell
Auf eine L4 mit 24 GB passt ein 8B-Modell in FP8, gpt-oss-20b mit 13,8 GB oder ein 14B-Modell in FP8 mit einem bescheidenen Cache. Auf eine L40S mit 48 GB passt ein 32B-Modell in FP8 mit Platz für Nutzer oder ein 70B-Modell in 4 Bit mit sehr wenig Platz. Keine der beiden Karten fasst gpt-oss-120b allein, und keine hat FP4-Arithmetik: Ada führt 4-Bit-Gewichte als INT4 über AWQ oder GPTQ aus, was TensorRT-LLM auf beiden Karten unterstützt, aber kein NVFP4. Die Bandbreite bestimmt dann das Tempo: Beim selben Modell kann die Token-Generierung für einen einzelnen Nutzer auf einer L40S bis zu etwa 2,9-mal so schnell laufen wie auf einer L4, im Verhältnis ihrer Bandbreiten; das ist eine Obergrenze aus den Spezifikationen, keine Messung.
Braucht das Modell mehr als 48 GB, ist keine der beiden Karten die Antwort. Die RTX PRO 6000 Server Edition mit 96 GB und die H200 NVL mit 141 GB sind die nächsten Stufen, und unser VRAM-Leitfaden hat die Rechnung.
Video, Grafik und virtuelle Desktops
Bei Video ist die L4 darauf ausgelegt, vorn zu liegen. Sie hat zwei Encoder, vier Decoder und vier JPEG-Decoder gegenüber drei und drei bei der L40S, und beide kodieren AV1. NVIDIA nennt bis zu 1.040 gleichzeitige AV1-Streams mit 720p30 für einen Server mit acht L4, etwa 130 je Karte, und die 120-fache KI-Videoleistung eines CPU-Servers mit zwei Sockeln in einer End-to-End-Pipeline; beide Werte stammen von Servern mit acht Karten, und nur der zweite ist ein Vergleich mit einem reinen CPU-Server. Für Videoanalyse, Transcoding und Kamerastreams ist die Zahl der Engines je Watt bei der L4 schwer zu schlagen.
Bei Grafik ist es umgekehrt. Die L40S hat 142 RT-Kerne und Displayausgänge, die sich einschalten lassen, und NVIDIA positioniert sie für Grafik und Video ebenso wie für KI. Für virtuelle Desktops eignen sich beide: Die L40S unterstützt bis zu 32 Nutzer je Karte mit 1-GB-Profilen, die L4 bis zu 24 mit 1-GB-Profilen, und beide brauchen NVIDIA-vGPU-Lizenzen.
Dichte und Leistungsaufnahme je Server
| SERVER | HÖHE | L4 MAXIMAL | L40S MAXIMAL |
|---|---|---|---|
| HPE ProLiant DL380a Gen11 | 2U | 8 | 4 |
| Lenovo ThinkSystem SR650 V3 | 2U | 8 | 3 |
| Lenovo ThinkSystem SR675 V3 | 3U | 8 | 8 |
| HPE ProLiant Compute DL380a Gen12 | 4U | 16 | 10 |
| Dell PowerEdge XE7745 | 4U | 16 | 8 |
Produktseiten und Product Guides von HPE, Dell und Lenovo; Höchstzahlen nach Angabe der Hersteller, September 2026.
Daraus folgt die Rechnung fürs Rack. Acht L4 ziehen 576 W und sechzehn 1.152 W; vier L40S ziehen 1.400 W und acht 2.800 W, jeweils ohne Prozessoren und Lüfter. Im selben Dell PowerEdge XE7745 kommen sechzehn L4 und acht L40S jeweils auf 384 GB GPU-Speicher; die Bestückung mit L40S hat 6.912 GB/s Gesamtbandbreite gegenüber 4.800 GB/s und zieht etwa das 2,4-Fache an Leistung. Sechzehn kleine Karten passen zu vielen kleinen Modellen oder vielen Streams; acht große zu weniger, größeren Modellen. Was das für den Raum bedeutet, behandelt unser Artikel zu Strom und Kühlung im Rack.
Wann welche Karte
Die L4 passt, wenn die Arbeit aus vielen kleinen Modellen oder vielen Streams besteht: Videoanalyse, Transcoding, Sprache, Embeddings, Modelle mit 7B bis 14B und virtuelle Desktops für Nutzer mit geringen Anforderungen. Sie ist auch die Karte für Server ohne GPU-Stromkabel, sofern der Serverhersteller die L4 für dieses Gehäuse und diesen Steckplatz listet (die Karte ist passiv gekühlt und auf den Luftstrom des Servers angewiesen), und für Racks, in denen jedes Watt zählt.
Die L40S passt, wenn ein Modell 24 bis 48 GB braucht, wenn der Durchsatz je Karte mehr zählt als je Watt und wenn dieselben Server auch Grafik oder Rendering übernehmen.
Keine der beiden passt zu einem 70B-Modell für ein Team oder zu etwas Größerem: Das ist das Revier der RTX PRO 6000 oder der H200 NVL.
Lebenszyklus und was danach kommt
Wir haben für keine der beiden Karten eine End-of-Life-Mitteilung von NVIDIA gefunden, und NVIDIAs vGPU-Lifecycle-Seite vom 3. August 2026 führt die L4 und die L40S unter den GPUs, die „weiterhin voll unterstützt“ werden. Diese Seite betrifft den Support der vGPU-Software, nicht die Frage, wie lange die Karten bestellbar bleiben. NVIDIA positioniert zwei Blackwell-Karten als ihre Nachfolger. Der L40S stellt NVIDIA die RTX PRO 6000 Blackwell Server Edition gegenüber, mit „bis zu 5-mal höherem Inferenzdurchsatz bei großen Sprachmodellen (LLM)“. Der L4 stellt NVIDIA die RTX PRO 4500 Blackwell Server Edition gegenüber, eine Single-Slot-Karte mit voller Bauhöhe, 165 W, 32 GB und 800 GB/s, die laut NVIDIA „mehr als die 5-fache Leistung der L4-GPU der vorherigen Generation“ liefert. Zu keiner der beiden Aussagen sind Testbedingungen veröffentlicht, und die RTX PRO 4500 ist keine Karte mit halber Bauhöhe, sie passt also nicht dorthin, wo eine L4 passt.
Was wir liefern
Eurokommerz liefert die NVIDIA L4 und die L40S EU-weit mit Herstellergarantie, als Karten oder in nach Auftrag gebauten Servern, und die RTX PRO 6000 Server Edition, wenn ein Modell ihnen entwächst. Schicken Sie uns die Arbeitslast und die Server, die Sie betreiben, und wir sagen Ihnen, welche Karte passt und wie viele davon das Rack mit Strom versorgen kann.
FAQ
Wie viel schneller ist die L40S als die L4?
5.1-0012) und einem mit zwei L4 (Eintrag 5.1-0018), geteilt durch die Zahl der GPUs, keine MLPerf-Metrik. Bei Sprachmodellen setzt ihre 2,9-mal höhere Bandbreite die Obergrenze für die Token-Generierung.Welche ist effizienter, die L4 oder die L40S?
Kann die L4 ein 70B-Modell ausführen?
Unterstützen die L4 und die L40S MIG?
Wie viele L4 passen in einen 2U-Server?
Sind die L4 und die L40S abgekündigt?
Nennen Sie uns die Modelle oder Streams, die Sie bedienen müssen, die Server, die Sie haben, und die verfügbare Leistung je Rack. Wir sagen Ihnen, welche Karte passt und wie viele davon. Wir antworten innerhalb eines Werktages.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages