BLOG · HARDWARE-REVIEW ·

NVIDIA L40S: was die veröffentlichten Benchmarks zeigen und wo die Karte 2026 steht

IN KÜRZE
  • Stand September 2026 haben wir keine End-of-Life-Mitteilung von NVIDIA für die L40S gefunden, und NVIDIA positioniert die RTX PRO 6000 Blackwell Server Edition mit doppelt so viel Speicher und 1,85-facher Bandbreite als ihre Nachfolgerin
  • NVIDIAs NIM-Tabellen zeigen für Llama 3.1 8B in FP8 auf einer L40S 71 Token pro Sekunde bei einer einzelnen Anfrage und insgesamt 2.869 bei 100 gleichzeitigen Anfragen mit 1.000 Token Eingabe und 1.000 Ausgabe
  • Bei 864 GB/s liegt die Obergrenze für einen einzelnen Stream dieses 8B-Modells nach unserer Rechnung bei rund 110 Token pro Sekunde, und ein 70B-Modell in FP8 (etwa 68 GiB) braucht zwei Karten
  • In NVIDIAs eigenen Tests im selben Servermodell leistete die RTX PRO 6000 Server Edition bei vier Bild-, Vision- und Videomodellen mit gleicher Batchgröße und Präzision das 1,74- bis 2,15-Fache einer L40S und bei zwei Vision-Modellen 10 bis 17 Prozent mehr je Watt, nach unserer Rechnung aus NVIDIAs Werten
  • Die L40S hat kein MIG und wird in Zeitscheiben geteilt: Im vGPU-Test von StorageReview kamen vier VMs mit je 12 GB, die Cinebench 2024 gleichzeitig ausführten, auf jeweils 2.514 bis 2.567, gegenüber 21.147 für eine VM mit der ganzen Karte

Die Karte im Überblick

NVIDIA hat die L40S im August 2023 als „leistungsstarken, universellen Rechenzentrumsprozessor“ angekündigt. Es handelt sich um eine Ada-Lovelace-Karte mit 18.176 CUDA-Kernen, 568 Tensor-Kernen der vierten Generation, 142 RT-Kernen der dritten Generation und 48 GB GDDR6 mit ECC bei 864 GB/s, spezifiziert mit 91,6 TFLOPS in FP32 und 733 TFLOPS in FP8 ohne Sparsity. Die passiv gekühlte Dual-Slot-Karte in voller Länge ist für maximal 350 W ausgelegt und über PCIe 4.0 x16 angebunden, ohne NVLink und ohne MIG. Drei NVENC- und drei NVDEC-Engines beherrschen AV1; die vier DisplayPort-1.4a-Ausgänge sind standardmäßig deaktiviert. NVIDIAs Angaben zum Marktstart, bis zu 1,2-mal so viel Inferenzleistung für generative KI und bis zu 1,7-mal so viel Trainingsleistung wie die A100, nannten keine Testbedingungen.

Ergebnisse in MLPerf® Inference, je Karte umgerechnet

MLCommons veröffentlicht jedes Ergebnis von MLPerf Inference zusammen mit den Logs des Laufs. Alle Ergebnisse in diesem Abschnitt stammen aus MLPerf Inference: Datacenter, Closed Division; die Tabelle zeigt das Offline-Szenario, in dem das System alle Samples auf einmal erhält und der Durchsatz gemessen wird.

BENCHMARK, OFFLINEEINTRAGGPUSSYSTEMERGEBNISJE KARTE
ResNet-50, Bilder/s5.0-00188 × L40S345.72143.215
RetinaNet, Bilder/s5.0-00188 × L40S6.522,2815
RetinaNet, Bilder/s5.1-00128 × L40S6.518,4815
SDXL, Bilder/s5.0-00188 × L40S6,20,78
Llama 2 70B, Token/s5.0-00188 × L40S3.481,5435

MLPerf Inference: Datacenter, Closed Division, Offline-Szenario. Eintrag 5.0-0018: v5.0 (April 2025), Dell PowerEdge XE7745; Eintrag 5.1-0012: v5.1 (September 2025), Cisco UCS C845A M8; beide mit acht L40S und NVIDIAs TensorRT-Stack. Gewichte so, wie MLCommons sie listet: INT8 für ResNet-50 und RetinaNet, FP8 für SDXL und für Llama 2 70B in der Variante mit 99 Prozent Genauigkeit. Abgerufen von mlcommons.org am 24. September 2026, Ergebnisse von der MLCommons Association verifiziert; das gilt für jedes MLPerf-Ergebnis in diesem Artikel, mit seiner Eintrags-ID in der Tabelle oder im Text. Je Karte ist unsere Rechnung: Systemergebnis geteilt durch die Zahl der GPUs, keine MLPerf-Metrik. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information.

Je Karte ergab die Objekterkennung nach unserer Rechnung dieselben 815 Bilder pro Sekunde in Dells Server mit acht Karten in v5.0 und in Ciscos Server mit acht Karten in v5.1, in derselben Division und im selben Szenario. Cisco trat in v5.0 auch mit einem Server mit zwei Karten an: Sein UCS C245 M8 (Eintrag 5.0-0012) erreichte im Offline-Szenario 57.832,5 Samples pro Sekunde beim Empfehlungsmodell DLRM v2, etwa 28.900 je Karte, und 1,4 Bilder pro Sekunde bei SDXL mit INT8-Gewichten, etwa 0,7 je Karte, gegenüber 0,78 je Karte mit FP8-Gewichten in Dells Server mit acht Karten, in derselben Runde, Division und im selben Szenario. Unser Vergleich mit der L4 stellt das RetinaNet-Ergebnis des Cisco-Servers mit acht Karten aus v5.1 einem L4-Server mit zwei Karten (Eintrag 5.1-0018) gegenüber: je Karte etwa 815 gegen 229 Bilder pro Sekunde, das 3,6-Fache, nach unserer Rechnung, in derselben Runde, Division und im selben Szenario; diese Läufe haben keine Leistungsaufnahme gemessen.

Im Server-Szenario von v5.0, in dem Anfragen zufällig eintreffen und die Latenzen im 99. Perzentil höchstens 2 s bis zum ersten Token und 200 ms je Ausgabe-Token betragen dürfen, lief Llama 2 70B auf Dells XE7745 mit 3.201,1 Token pro Sekunde (Eintrag 5.0-0018, Closed Division). Das zugehörige Log zeigt im 99. Perzentil 0,47 s bis zum ersten Token und 110 ms je Ausgabe-Token sowie im Mittel 99 ms je Ausgabe-Token, nach unserer Rechnung etwa zehn Token pro Sekunde für eine Antwort.

Die Ergebnistabellen von MLCommons führen weitere Einträge mit der L40S, darunter den ProLiant DL380a Gen12 von HPE mit acht Karten in v5.0 und Läufe von Red Hat mit der Open-Source-Engine vLLM in v5.1 und v6.0 (April 2026); wir beschränken uns auf die oben genannten Ergebnisse von Dell und Cisco. Wir lassen v4.0 und v4.1 weg, deren Ergebnistabellen wir am 24. September 2026 nicht öffnen konnten, sowie die Runde v6.1 vom 16. September 2026.

Sprachmodelle: Die Bandbreite gibt das Tempo vor

Bei einer einzelnen Anfrage ist das Tempo dadurch begrenzt, wie schnell die Karte ihre Gewichte liest, denn bei einem dichten Modell werden für jedes neue Token alle Schichtgewichte und die Ausgabeschicht einmal gelesen. Das vollständigste Bild für eine einzelne Karte liefern NVIDIAs Tabellen für NIM, seinen paketierten Inferenz-Microservice (NIM 1.8, Seite aktualisiert am 20. Juli 2026): Llama 3.1 8B Instruct auf einer L40S in einem Supermicro-Server, mit 1.000 Eingabe- und 1.000 Ausgabe-Token pro Anfrage.

PARALLELE ANFRAGENERSTES TOKENJE AUSGABE-TOKENTOK/S, GESAMT
145 ms14,0 ms71
25618 ms18,6 ms1.302
100778 ms34,1 ms2.869
200894 ms55,3 ms3.560
2505,0 s62,7 ms3.676

NVIDIA, Benchmark-Tabellen für NIM LLM, Llama 3.1 8B Instruct in FP8 auf einer L40S; der Durchsatz ist NVIDIAs Summe für alle Anfragen zusammen, nach unserer Prüfung in Ausgabe-Token pro Sekunde.

Nach unserer Rechnung liest das Modell in FP8 pro Token 7,5 bis 8 GB, seine linearen Schichten plus eine Ausgabeschicht, die in BF16 bleiben kann, also begrenzen 864 GB/s einen Stream auf rund 110 Token pro Sekunde; NVIDIA hat 71 gemessen, etwa zwei Drittel davon. In BF16 zeigen die Tabellen 45 Token pro Sekunde gegenüber einer Obergrenze von etwa 58. Bei 100 gleichzeitigen Anfragen bekommt jede nach unserer Rechnung noch etwa 29 Token pro Sekunde. Zwischen 200 und 250 Anfragen springt die Zeit bis zum ersten Token von unter 0,9 s auf 5 s. Lange Prompts stoßen früher an die Grenze: Mit 20.000 Eingabe-Token dauert das erste Token 1,3 s für eine Anfrage und 27,5 s für 25, und die gesamte Ausgabe bleibt ab 25 Anfragen bei rund 290 Token pro Sekunde. Nach unserer Rechnung belegt jede solche Anfrage selbst in FP8 einen KV-Cache von 1,3 GiB, sodass nicht mehr als etwa 20 gleichzeitig Platz finden, nach der Sizing-Methode unseres Leitfadens zu gleichzeitigen Nutzern: 90 Prozent der 48 GB der Karte, abzüglich rund 3 GiB Overhead und der Gewichte. Die MLPerf-Werte beruhen auf anderen Datensätzen und Einstellungen und sind mit diesen nicht vergleichbar.

Was in 48 GB passt

Ein 70B-Modell in FP8, bei Llama 3.3 70B etwa 68 GiB Gewichte, passt nicht auf eine L40S; auf dieser Karte ist es eine Aufgabe für mindestens zwei Karten über PCIe, aufgeteilt per Tensor-Parallelismus oder per Pipeline-Parallelismus, den die Dokumentation von vLLM für höheren Durchsatz auf GPUs ohne NVLink wie der L40S vorschlägt. In 4 Bit passt ein 70B-Modell nur knapp: Ein INT4-AWQ-Checkpoint von Llama 3.1 70B ist etwa 39,8 GB groß; das lässt nach unserer Sizing-Methode etwa 0,2 GB frei und bestenfalls etwa 1,4 GB, wenn die Engine nur 2 GB braucht: Platz für höchstens ein Gespräch mit 8.192 Token, und nur mit einem FP8-Cache (1,34 GB gegenüber 2,7 GB mit einem 16-Bit-Cache). Ein 32B-Modell in FP8 passt mit Platz für Nutzer, und ein 8B-Modell in FP8 lässt mehr als 30 GB für den Cache frei. Ada hat keine FP4-Arithmetik: Die Support-Matrix von TensorRT-LLM vom 21. September 2026 führt für die Architektur Per-Tensor-FP8, einen FP8-KV-Cache sowie INT4 AWQ und GPTQ (W4A16 und W4A8), aber nicht NVFP4, MXFP4 oder blockskaliertes FP8.

Gegenüber einer RTX PRO 6000 Server Edition haben zwei L40S dieselben 96 GB und nach unserer Rechnung zusammen etwas mehr Bandbreite, 1.728 gegenüber 1.597 GB/s, bei 700 W gegenüber bis zu 600 W und doppelter Steckplatzbreite. Mit Tensor-Parallelismus tauscht ein auf zwei Karten aufgeteiltes Modell aber pro Schicht zweimal Daten über PCIe 4.0 aus, und das Paar hat weder MIG noch FP4-Arithmetik: NVFP4, das Llama 3.3 70B auf etwa 40 GiB schrumpfen lässt, läuft auf Ada nur in vLLM, als Kompression, bei der nur die Gewichte quantisiert sind (Weight-only), und nicht in TensorRT-LLM.

Bild, Vision und Video

NVIDIAs Seite zur Inferenzleistung (September 2026) führt eine L40S und eine RTX PRO 6000 Server Edition im selben Servermodell Supermicro SYS-521GE-TNRT und im selben TensorRT-Container. Wo Batchgröße und Präzision übereinstimmen:

MODELL UND EINHEITPRÄZISION, BATCHL40SRTX PRO 6000 SEVERHÄLTNIS
Swin Base, Samples/sFP8, 321.3922.7131,95×
Swin Large, Samples/sFP8, 327031.5122,15×
ControlNet, Bilder/sgemischt, 41,592,771,74×
Video-Diffusion, Videos/mingemischt, 11,342,822,10×

NVIDIA, Tabellen zur KI-Inferenzleistung, TensorRT-Container 26.07, synthetische Daten, jeweils eine GPU; Swin-Modelle mit Sequenzlänge 384; das Videomodell ist Stable Video Diffusion. Die Verhältnisse sind unsere Rechnung.

Je Watt ist der Abstand klein: NVIDIAs Effizienzspalte weist für die L40S bei den beiden Swin-Modellen 4,17 und 2,16 Samples pro Sekunde je Watt aus, gegenüber 4,58 und 2,52 für die RTX PRO 6000, nach unserer Rechnung 10 und 17 Prozent mehr. Für die Bildgenerierung nennt dieselbe Seite für die L40S 0,36 Bilder pro Sekunde mit Stable Diffusion XL bei Batch 1 und ein Flux-Bild alle 12,5 s in FP8; die Zeilen der RTX PRO 6000 verwenden Batch 4 beziehungsweise FP4 und sind daher nicht vergleichbar.

Die L40S hat drei NVENC-Encoder der achten Generation mit AV1 und laut NVIDIAs Codec-Matrix kein Sitzungslimit, aber keine 4:2:2-Kodierung in H.264 oder HEVC, die bei den vier Encodern der neunten Generation der RTX PRO 6000 Server Edition hinzukommt. Für Transcoding und Kamerastreams bietet die L4 mit zwei Encodern, vier Decodern und vier JPEG-Decodern bei 72 W mehr Video-Engines je Watt.

Virtuelle Workstations: Zeitscheiben statt Partitionen

Die L40S wird per Time-Sliced vGPU geteilt und steht ab Release 16.1 auf NVIDIAs vGPU-Liste; NVIDIAs Release Notes für vGPU 20 (Treiberzweig R595) auf VMware vSphere vom September 2026 decken sie auf VCF 9.0 und VCF 9.1 sowie auf ESXi 8.0 Update 3 P06 und späteren 8.0-Updates ab und erlauben ab ESXi 8.0 Update 3 gemischte Profilgrößen auf einer Karte. Die Profile der Q-Serie, für die eine Lizenz für NVIDIA RTX vWS nötig ist, reichen von L40S-1Q bis L40S-48Q: bis zu 32 VMs mit je 1 GB, sechs mit 8 GB (vier, wenn Profilgrößen gemischt werden) und eine mit der ganzen Karte. Compute-Profile werden über NVIDIA AI Enterprise lizenziert, das nicht zum Lieferumfang der Karte gehört.

StorageReview hat im April 2025 gezeigt, was Time-Slicing unter Last bedeutet. Auf einem Dell PowerEdge R760 mit einer L40S, Proxmox VE und vGPU 18.0 erreichte eine VM mit L40S-48Q 21.147 Punkte im GPU-Test von Cinebench 2024. Vier VMs mit L40S-12Q, die ihn gleichzeitig ausführten, kamen auf jeweils 2.514 bis 2.567, nach unserer Rechnung zusammen weniger als die Hälfte davon, während eine VM mit 12 GB allein 15.133 erreichte. In Blender sank eine VM auf gerade einmal 8 Prozent des Ergebnisses einer einzeln laufenden VM. NVIDIAs standardmäßiger Best-Effort-Scheduler gleicht die Rechenzyklen zwischen den laufenden vGPUs aus; die Equal-Share- und Fixed-Share-Scheduler von NVIDIA geben stattdessen jeder vGPU einen festgelegten Anteil. Dimensionieren Sie die Plätze für die Spitze gleichzeitiger Nutzung; unser Leitfaden zu MIG und vGPU nennt die Zahl der Plätze und die Lizenzen. NVIDIA validiert jedes vGPU-Release für bestimmte ESXi-Versionen, planen Sie Updates von vSphere und vGPU daher gemeinsam; unser Engineering-Partner Vixen.UNO übernimmt Versions- und Architektur-Updates von vSphere im Rahmen unserer Leistung VMware-Optimierung.

Strom, Kühlung und Software

NVIDIAs Product Brief gibt für die Leistungsaufnahme der Karte 350 W sowohl als Standard- als auch als Maximalwert an, nennt kein Minimum und sieht für die Stromversorgung einen 16-poligen Zusatzanschluss vor. Einen Lüfter gibt es nicht: Der Kühlkörper lässt sich von beiden Seiten durchströmen, die Lüfter des Servers müssen 350 W pro Karte abführen, und NVIDIA spezifiziert die Karte für 0 bis 50 °C im Betrieb. Die Dual-Slot-Karte misst 4,4 mal 10,5 Zoll und wiegt ohne Slotblende und Verlängerungen 1.052 g; acht davon ziehen 2.800 W, ohne Prozessoren und Lüfter. Als Software-Minimum nennt NVIDIAs Product Brief von 2023 den Treiberzweig R535 mit CUDA 12.2 und vGPU 16.1 für die Virtualisierung; R535 hat laut NVIDIAs Treibertabelle vom 9. September 2026 im Juni 2026 das Ende seines Lebenszyklus erreicht, eine neue Installation beginnt also auf einem unterstützten Zweig wie R580 oder R595. FP8 setzt Compute Capability 8.9 oder neuer voraus, und die hat Ada. Ohne NVLink tauschen die Karten Daten über PCIe 4.0 x16 aus, mit 64 GB/s in beiden Richtungen zusammen.

Wo die Karte 2026 steht

Stand September 2026 haben wir keine End-of-Life-Mitteilung von NVIDIA für die L40S gefunden, und NVIDIAs vGPU-Lifecycle-Seite vom 3. August 2026 führt sie unter den GPUs, die „weiterhin voll unterstützt“ werden; diese Seite betrifft den Support der vGPU-Software, nicht die Frage, wie lange die Karte bestellbar bleibt. NVIDIA positioniert die RTX PRO 6000 Blackwell Server Edition als ihre Nachfolgerin und nennt „bis zu 5-mal höheren Inferenzdurchsatz bei großen Sprachmodellen (LLM)“, ohne veröffentlichte Testbedingungen; NVIDIAs eigene Tabellen zu Bild, Vision und Video oben zeigen nach unserer Rechnung das 1,74- bis 2,15-Fache an Durchsatz je Karte. Die RTX PRO 6000 Server Edition hat doppelt so viel Speicher, die 1,85-fache Bandbreite, FP4, MIG und PCIe 5.0, bei bis zu 600 W gegenüber 350 W.

Die L40S bleibt die richtige Karte, wenn die Modelle in 48 GB passen (Sprachmodelle von 8B bis 32B, Vision, Bildgenerierung), wenn die Server bereits für doppelt breite Karten mit 350 W qualifiziert sind, wenn dieselben Hosts Grafik und virtuelle Workstations bedienen und wenn ein bestehender L40S-Bestand mit denselben Profilen und Ersatzteilen wächst. Die falsche Karte ist sie für ein 70B-Modell, das ein Team bedient, für Mandanten, die Hardware-Isolation brauchen, für Modelle, die FP4-Arithmetik brauchen, und für Video-Transcoding in hoher Dichte.

Was wir liefern

Eurokommerz liefert die NVIDIA L40S EU-weit mit Herstellergarantie, mit EU-Vertrag und EU-Rechnung, als einzelne Karten oder in auf Bestellung gebauten GPU-Servern, einschließlich VDI- und Rendering-Knoten mit RTX PRO Blackwell, L40S oder L4 und NVIDIA-vGPU-Lizenzierung auf derselben Rechnung wie die Hardware. Wächst ein Modell über 48 GB hinaus, liefern wir die RTX PRO 6000 Server Edition und die H200 NVL. Für vGPU-Umgebungen auf vSphere erbringt unser Engineering-Partner Vixen.UNO die VMware-Optimierung: Er auditiert die Umgebung und ihre Lizenzen, passt die Broadcom-Editionen an die realen Workloads an und modernisiert vSphere in vereinbarten Wartungsfenstern, mit Support unter einem vereinbarten SLA.

FAQ

Wie viele Token pro Sekunde erzeugt eine NVIDIA L40S?
In NVIDIAs NIM-Benchmark-Tabellen erzeugt Llama 3.1 8B in FP8 auf einer L40S 71 Token pro Sekunde für eine einzelne Anfrage (14,0 ms pro Token) und insgesamt 2.869 Token pro Sekunde für 100 gleichzeitige Anfragen mit 1.000 Eingabe- und 1.000 Ausgabe-Token. In BF16 läuft eine einzelne Anfrage mit 45 Token pro Sekunde.
Kann eine einzelne L40S ein 70B-Modell ausführen?
Nicht in FP8: Llama 3.3 70B braucht für seine Gewichte etwa 68 GiB, mehr als die 48 GB der Karte. Ein INT4-AWQ-Checkpoint mit etwa 39,8 GB passt, lässt aber nach unserer Rechnung Platz für höchstens ein Gespräch mit 8.192 Token, und nur mit einem FP8-Cache; um ein 70B-Modell für ein Team bereitzustellen, braucht es daher mindestens zwei L40S über PCIe oder eine RTX PRO 6000 Server Edition mit 96 GB.
Welche Ergebnisse hat die L40S in MLPerf Inference?
In MLPerf Inference: Datacenter v5.0 (Closed Division, Offline-Szenario; Eintrag 5.0-0018, abgerufen von mlcommons.org am 24. September 2026, Ergebnis von der MLCommons Association verifiziert) verarbeitete ein Dell PowerEdge XE7745 mit acht L40S 3.481,5 Token pro Sekunde mit Llama 2 70B, 6.522 Bilder pro Sekunde mit RetinaNet und 345.721 mit ResNet-50. Unsere Rechnung, Systemergebnis geteilt durch die Zahl der GPUs, keine MLPerf-Metrik, ergibt etwa 435 Token pro Sekunde je Karte sowie 815 und 43.215 Bilder pro Sekunde je Karte.
Unterstützt die L40S MIG, NVLink oder FP4?
Nein, keines der drei. Die Karte wird per Time-Sliced vGPU geteilt, der Datenverkehr zwischen mehreren Karten läuft über PCIe 4.0 x16, und ihre Tensor-Kerne verarbeiten FP8, aber nicht FP4, daher laufen 4-Bit-Modelle in TensorRT-LLM als INT4 AWQ oder GPTQ; vLLM kann NVFP4- und MXFP4-Checkpoints außerdem als FP4 laden, bei dem nur die Gewichte quantisiert sind (Weight-only).
Wie viele virtuelle Workstations unterstützt eine L40S?
Bis zu 32 VMs mit dem 1-GB-Profil der Q-Serie, sechs mit 8 GB und eine mit den vollen 48 GB, und jede braucht eine Lizenz für NVIDIA RTX vWS. Die VMs teilen sich die Karte in Zeitscheiben, die Leistung jedes Platzes hängt also davon ab, wie viele gleichzeitig aktiv sind.
Wird die L40S 2026 noch unterstützt?
NVIDIAs vGPU-Lifecycle-Seite vom 3. August 2026 führt die L40S als voll unterstützt, und Stand September 2026 haben wir keine End-of-Life-Mitteilung von NVIDIA gefunden. Diese Seite betrifft den Support der vGPU-Software, nicht die Frage, wie lange die Karte bestellbar bleibt. NVIDIA positioniert die RTX PRO 6000 Blackwell Server Edition als Nachfolgerin der Karte.

Schicken Sie uns die Arbeitslast: die Modelle, die Präzision und die gleichzeitigen Nutzer oder die Plätze und Anwendungen für virtuelle Workstations, dazu die Server und den Hypervisor, die Sie betreiben. Wir nennen Ihnen die passende Karte und Konfiguration, ob L40S, RTX PRO 6000 Server Edition oder L4, und die dafür nötigen vGPU-Lizenzen. Wir antworten innerhalb eines Werktages.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at  ·  +43 1 585 1405 50  ·  Jordangasse 7, 1010 Wien