BLOG · VERGLEICH ·

L40S vs. RTX PRO 4500 Server Edition: 48 GB bei 350 W oder 32 GB bei 165 W je Karte

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Die L40S hat 48 GB GDDR6 mit 864 GB/s auf einer Dual-Slot-Karte mit 350 W, die RTX PRO 4500 Blackwell Server Edition 32 GB GDDR7 mit 800 GB/s auf einer Single-Slot-Karte mit 165 W; beide sind passiv gekühlt
  • Die Server Edition bringt FP4-Tensor-Kerne, MIG mit zwei Instanzen zu 16 GB, PCIe 5.0 und 4:2:2-Encoding in H.264 und HEVC mit; die L40S hat 73 Prozent mehr CUDA-Kerne und 91,6 gegenüber 51 TFLOPS in FP32
  • Nach unserer Dimensionierungsregel passt ein 32B-Modell in FP8 mit Cache für etwa fünf 8K-Gespräche bei aktiviertem ECC, acht bei deaktiviertem, auf eine L40S, aber nicht in 32 GB, während Qwen3-14B in FP8 auf beide Karten passt, für etwa 35 und 13 Gespräche bei aktiviertem ECC
  • In einem 2U-Layout mit vier GPU-Steckplätzen doppelter oder acht einfacher Breite, etwa im SR650a V4 von Lenovo, ergeben acht Karten der Server Edition 256 GB GPU-Speicher bei 1.320 W Leistungsaufnahme der Karten, vier L40S 192 GB bei 1.400 W
  • NVIDIA stellt die RTX PRO 6000 Server Edition der L40S gegenüber und die RTX PRO 4500 Server Edition der L4, und NVIDIAs vGPU-Liste vom 2. Oktober 2026 führt die L40S und die RTX PRO 4500 Server Edition als voll unterstützt

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

L40S vs. RTX PRO 4500 Server Edition: die kurze Antwort

Die NVIDIA L40S hat 48 GB GDDR6 mit 864 GB/s auf einer Dual-Slot-Karte mit 350 W, die RTX PRO 4500 Blackwell Server Edition 32 GB GDDR7 mit 800 GB/s auf einer Single-Slot-Karte mit 165 W. Wählen Sie die L40S, wenn ein Modell mit seinem Cache mehr als etwa 24 GiB auf einer Karte braucht, zum Beispiel ein 32B-Modell in FP8, oder wenn Sie eine bestehende L40S-Umgebung erweitern. Wählen Sie die RTX PRO 4500 Server Edition, wenn die Modelle in 32 GB passen und der Server Steckplätze einfacher Breite hat: Sie bringt FP4-Tensor-Kerne, zwei MIG-Instanzen zu 16 GB, PCIe 5.0 und 4:2:2-Video-Encoding mit, und ein 2U-Server mit acht Steckplätzen einfacher Breite kann doppelt so viele davon aufnehmen, sofern sein Hersteller die Karte für diese Steckplätze führt.

Technische Daten von L40S und RTX PRO 4500 Server Edition

SPEZIFIKATIONL40SRTX PRO 4500 SE
ArchitekturAda LovelaceBlackwell
CUDA-Kerne18.17610.496
GPU-Speicher48 GB GDDR6 mit ECC32 GB GDDR7 mit ECC, 256 Bit
Speicher­bandbreite864 GB/s800 GB/s
FP8 Tensor733 TFLOPS dicht, 1.466 mit Sparsity811 TFLOPS, Basis nicht angegeben
FP4 Tensorkeine1,6 PFLOPS, Basis nicht angegeben
FP3291,6 TFLOPS51 TFLOPS
Maximale Leistungs­aufnahme350 W165 W
KarteDual Slot, 4,4 × 10,5 Zoll, passivSingle Slot, volle Bauhöhe, volle Länge, passiv
Host-Schnitt­stellePCIe 4.0 x16PCIe 5.0 x16
MIGneinbis zu 2 Instanzen zu 16 GB
vGPU, erstes Release16.120.0
NVENC und NVDEC3 und 3, mit AV13 und 3, mit 4:2:2-Encoding in H.264 und HEVC
NVLinkneinnein

NVIDIA-Produktseite der L40S; NVIDIA-Produktseite, Datenblatt (5192801, April 2026) und Product Brief PB-12790-001_02 (20. April 2026) der RTX PRO 4500 Blackwell Server Edition; NVIDIAs Liste der von vGPU unterstützten GPUs, aktualisiert am 2. Oktober 2026.

Die L40S ist der größere Chip, mit 73 Prozent mehr CUDA-Kernen und dem 1,8-Fachen der FP32-Rate, aber nur 8 Prozent mehr Speicherbandbreite. NVIDIA gibt nicht an, ob die 811 TFLOPS FP8 der Server Edition Sparsity einschließen; auf der Seite der L40S ist 733 der dichte Wert und 1.466 der Wert mit Sparsity. Ist NVIDIAs Blackwell-Wert ein Sparsity-Wert, hat die L40S je Karte die höhere FP8-Rate. Je Server kehrt sich die Reihenfolge um: Acht Karten der Server Edition kommen nach unserer Rechnung zusammen auf 6.488 TFLOPS, vier L40S auf 2.932 dicht oder 5.864 mit Sparsity.

Unser Leitfaden zur RTX PRO 4500 Server Edition behandelt die Karte für sich, und unser Review der L40S-Benchmarks die veröffentlichten Messungen der älteren Karte.

Welche Modelle in 32 GB und in 48 GB passen

Wir dimensionieren mit der Regel aus unserem Leitfaden dazu, wie viel VRAM ein LLM braucht: 90 Prozent des Kartenspeichers, abzüglich etwa 3 GiB für Aktivierungen und Laufzeitumgebung, nehmen die Gewichte und den KV-Cache auf. Beide Karten haben ECC-Speicher, der bei GDDR-Karten laut NVIDIAs CUDA C++ Best Practices Guide den verfügbaren Speicher um 6,25 Prozent verringert. Bei aktiviertem ECC bleiben damit etwa 37,3 GiB für Gewichte und Cache auf der L40S und 23,9 GiB auf der RTX PRO 4500 Server Edition, bei deaktiviertem ECC 40,0 und 25,7 GiB; nvidia-smi -q zeigt den ECC-Modus der gelieferten Karte. Der Cache eines Gesprächs ergibt sich aus der config.json des Modells, und mit FP8-Cache bei vollem Kontext von 8.192 Token belegt er 0,5625 GiB für Qwen3-8B, 0,625 GiB für Qwen3-14B und 1 GiB für Qwen3-32B.

MODELL UND FORMATGEWICHTEL40SRTX PRO 4500 SE
Qwen3-8B, FP88,8 GiBetwa 50 (55)etwa 26 (30)
Qwen3-14B, FP815,2 GiBetwa 35 (39)etwa 13 (16)
Qwen3-32B, NVFP419,3 GiBkeine FP4-Tensor-Kerneetwa 4 (6)
Qwen3-32B, FP832,0 GiBetwa 5 (8)passt nicht
Llama 3.3 70B, NVFP439,8 GiBkein Platz für Cachepasst nicht

Gleichzeitige Gespräche mit 8.192 Token je Karte mit FP8-KV-Cache, nach unserer Rechnung, zuerst mit aktiviertem ECC, in Klammern mit deaktiviertem ECC; der Kartenspeicher ist unsere Schätzung dessen, was der Treiber meldet. Gewichte: NVIDIAs FP8- und NVFP4-Checkpoints und Qwens FP8-Version von Qwen3-32B auf Hugging Face, abgerufen am 10. Oktober 2026; Schichten und KV-Heads aus der jeweiligen config.json.

Die Trennlinie bildet ein 32B-Modell in FP8, das mit Platz für etwa fünf Gespräche (acht bei deaktiviertem ECC) auf die L40S passt und nicht auf die Server Edition. Qwens FP8-Version skaliert ihre Gewichte in Blöcken von 128 × 128, ein Format, das die Support-Matrix von TensorRT-LLM für Ada nicht führt, wie unser Review der L40S-Benchmarks anmerkt; prüfen Sie also, ob Ihre Serving-Engine es auf der L40S ausführt. In NVFP4 passt dasselbe Modell auf die Blackwell-Karte, für etwa vier Gespräche (sechs bei deaktiviertem ECC). Ada hat keine FP4-Tensor-Kerne, deshalb führt vLLM NVFP4 auf der L40S nur als Weight-only-Kompression aus, und andere 4-Bit-Modelle laufen als INT4 über AWQ oder GPTQ. Modelle bis 14B in FP8 passen auf beide Karten, und die L40S fasst je Karte mehr als doppelt so viele Qwen3-14B-Gespräche. Das Tempo für einen Nutzer liegt nah beieinander, weil ein dichtes Modell seine Gewichte einmal je Token liest: Für Qwen3-14B in FP8 mit 16,3 GB Gewichten liegt die Obergrenze nach unserer Rechnung bei etwa 53 Token pro Sekunde auf der L40S und 49 auf der Server Edition.

Summen je 2U-Server mit vier oder acht GPU-Steckplätzen

Lenovo Press beschreibt den ThinkSystem SR650a V4, einen 2U-Server, mit „Unterstützung für bis zu 4 GPUs doppelter Breite oder 8 GPUs einfacher Breite, eingebaut in den vorderen Steckplätzen“ (LP2128, aktualisiert am 5. Oktober 2026) und führt „4x NVIDIA L40S 350W GPUs“ unter seinen Merkmalen. Lenovos Guide zur RTX PRO 4500 Server Edition (LP2391) vermerkt in seinem Update vom 28. Juli 2026: „Der SR650a V4 unterstützt die GPU jetzt“. Lenovos eigenes Beispiel mit acht Karten lautet „8x NVIDIA L4 single-wide GPUs“, und keiner der beiden Guides, die wir lesen konnten, nennt, wie viele Karten der RTX PRO 4500 Server Edition der Server aufnimmt. Die Tabelle nutzt dieses Layout als Beispiel; die Zahl der Karten je Server kommt aus dem Konfigurator des Herstellers.

JE 2U-SERVER4 × L40S8 × RTX PRO 4500 SE
GPU-Speicher192 GB256 GB
Leistungs­aufnahme, GPUs1.400 W1.320 W
Bandbreite, Summe3.456 GB/s6.400 GB/s
FP32, Summe366 TFLOPS408 TFLOPS
NVENC und NVDEC12 und 1224 und 24
MIG-Instanzenkeine16 zu 16 GB
Qwen3-14B FP8, 8Ketwa 140 (156)etwa 104 (128)
Qwen3-32B FP8, 8Ketwa 20 (32)passt nicht
vPC-Nutzer, maximal128 mit 1-GB-Profilen128 mit 2-GB-Profilen

Beispiel-Layout, keine Konfiguration: Steckplätze aus Lenovo Press LP2128; Werte je Karte aus NVIDIAs Produktseiten; Gespräche aus der Tabelle oben, mit aktiviertem und in Klammern deaktiviertem ECC; vPC-Nutzer je Karte aus NVIDIAs vPC-Sizing-Leitfaden, aktualisiert am 19. August 2026. Summen nach unserer Rechnung.

Der Server mit acht Karten hat ein Drittel mehr GPU-Speicher bei etwas geringerer Leistungsaufnahme der Karten, fast die doppelte summierte Bandbreite und doppelt so viele Video-Engines. Jede Karte fasst weniger, deshalb sinkt die Zahl für Qwen3-14B bei aktiviertem ECC von etwa 140 auf 104, und ein 32B-Modell in FP8 muss per Tensor-Parallelität über PCIe auf zwei Karten aufgeteilt werden, da keine der beiden Karten NVLink hat. Bei 8B-Modellen dreht sich die Reihenfolge wieder: etwa 208 Gespräche auf acht Karten der Server Edition gegenüber 200 auf vier L40S bei aktiviertem ECC.

Wir bauen KI-Server mit beiden Karten nach Auftrag und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Nennen Sie uns die Modelle, die Spitzenzahl der Gespräche und den Server oder die Rack-Position, und wir antworten mit der Zahl der Karten je Server.

MIG und vGPU auf der L40S und der RTX PRO 4500 Server Edition

NVIDIAs MIG-Leitfaden, aktualisiert am 11. September 2026, führt bis zu zwei MIG-Instanzen 1g.16gb je Karte RTX PRO 4500 Blackwell, jede mit der Hälfte des Speichers, der Hälfte der SMs und je einer NVENC-, NVDEC- und JPEG-Engine, sowie 2g.32gb für die ganze Karte. Die L40S hat kein MIG und teilt Speicher und Rechenleistung in Zeitscheiben. Nach unserer Dimensionierungsregel fasst jede 16-GB-Instanz Qwen3-8B in FP8 mit Cache für etwa vier 8K-Gespräche bei deaktiviertem ECC oder zwei bei aktiviertem, sodass ein Server mit acht Karten 16 getrennte kleine Modelle mit Hardware-Isolation zwischen ihnen betreiben kann.

Für Compute-VMs führt die vGPU-Referenz von NVIDIA AI Enterprise (Release 8.2, aktualisiert am 2. September 2026) L40S-Typen von L40S-48C bis hinunter zu L40S-4C, also zwölf VMs zu 4 GB je Karte. Der kleinste Compute-Typ der RTX PRO 4500 Server Edition hat 8 GB, vier je Karte, per Time-Slicing als DC-8C oder auf MIG-Basis als DC-2-8C. Im 2U-Beispiel ergibt das 48 Compute-VMs zu 4 GB auf vier L40S und 32 zu 8 GB auf acht Karten der Server Edition.

Für virtuelle Desktops gibt NVIDIAs vPC-Sizing-Leitfaden der Server Edition 16 Nutzer je Karte mit 2-GB-Profilen und kennzeichnet 1-GB-Profile mit „Not supported on Blackwell“; die L40S erreicht 32 Nutzer je Karte mit 1-GB-Profilen. Der Leitfaden fügt hinzu, dass seine Tabelle „die maximal unterstützte Dichte und keinen empfohlenen Einsatzpunkt wiedergibt“. Vier L40S und acht Karten der Server Edition kommen damit auf dieselben 128 Nutzer, und jeder Blackwell-Platz hat den doppelten Framebuffer.

NVIDIAs Lizenzierungsleitfaden hält fest, dass NVIDIA AI Enterprise „pro GPU lizenziert wird“ und dass eine Lizenz „für jede GPU erforderlich ist, die im Server oder in der Workstation installiert ist“, auf dem seine Software läuft; ein Server mit acht Karten, der sie betreibt, braucht also acht Lizenzen, wo ein Server mit vier Karten vier braucht. Virtuelle Desktops werden anders lizenziert: Lenovos Guide zur Karte führt Lizenzen für vPC, vApps und RTX vWS je gleichzeitigem Nutzer (CCU).

Wir liefern beide Karten mit Lizenzen für NVIDIA vGPU und AI Enterprise unter einem EU-Vertrag und auf einer Rechnung. Beschreiben Sie die Zahl der Plätze, die Profilgrößen und den Hypervisor im Formular unten, und wir dimensionieren die Karten je Host.

Video-Engines, Stromversorgung und Luftstrom

Jede Karte hat drei NVENC- und drei NVDEC-Engines, acht Karten bringen also je 24 mit und vier je 12. NVIDIA schreibt, dass die Blackwell-Encoder „neu 4:2:2-Encoding in H.264 und HEVC unterstützen“, und die Seite der L40S nennt AV1-Encoding und -Decoding für ihre Engines.

Unser Leitfaden zu Strom und Kühlung für ein GPU-Rack plant etwa 160 CFM Luftstrom je kW bei 11 °C Temperaturanstieg; das sind nach unserer Rechnung etwa 26 CFM je Karte der Server Edition und 56 CFM je L40S, oder 211 und 224 CFM je Server vor Prozessoren, Arbeitsspeicher und Laufwerken. NVIDIAs Product Brief PB-12790-001_02 gibt für die Server Edition einen Umgebungstemperaturbereich im Betrieb von 10 bis 45 °C an und eine Leistungsgrenze, die sich von 165 W bis hinunter auf 100 W einstellen lässt. Beide Karten haben einen 16-poligen Stromanschluss, der Server mit acht Karten braucht also acht GPU-Stromkabel, und Lenovos Guide zur Karte führt ein Hilfsstromkabel für den SR650a V4.

L40S-Nachfolger und Blackwell-Alternativen: was NVIDIA sagt

Die Produktseite der L40S nennt keinen Nachfolger. NVIDIAs Seite zur RTX PRO 6000 Blackwell Server Edition schreibt, dass die Karte „einen massiven Leistungssprung gegenüber der NVIDIA L40S der Vorgängergeneration“ liefert, ohne Testbedingungen auf der Seite. Die Seite der RTX PRO 4500 Server Edition vergleicht die Karte stattdessen mit der L4 und verspricht „mehr als die 5-fache Leistung der L4-GPU der Vorgängergeneration“, ebenfalls ohne Bedingungen. Für virtuelle PCs nennt NVIDIAs vPC-Sizing-Leitfaden die RTX PRO 4500 Server Edition „einen starken Modernisierungspfad für Kunden, die von früheren Generationen von Rechenzentrums-GPUs wechseln“, und zählt Ada Lovelace (L-Serie) dazu. Unser Vergleich von L40S und RTX PRO 6000 Server Edition behandelt dieses Paar.

Die RTX PRO 4500 Server Edition wird zur Alternative zur L40S, wenn sich das Serverdesign mit ihr ändert: mehr Karten mit 32 GB je Server, mit MIG partitioniert, bei weniger als der halben Leistung je Karte. NVIDIAs vGPU-Supportliste, aktualisiert am 2. Oktober 2026, führt beide Karten mit „Full Support“ und dem Status „Active“.

Wann Sie die L40S oder die RTX PRO 4500 Server Edition wählen sollten

Wählen Sie die L40S, wenn ein Modell mit seinem Cache mehr als etwa 24 GiB auf einer Karte braucht, etwa ein 32B-Modell in FP8, wenn die Arbeitslast auf FP32-Arithmetik setzt oder wenn die Server Steckplätze doppelter Breite haben, die für Karten mit 350 W qualifiziert sind.

Wählen Sie die RTX PRO 4500 Server Edition für viele Modelle bis 14B in FP8 oder 32B in NVFP4, für Embedding- und Reranking-Modelle neben einem Assistenten, für Abteilungen, die Hardware-Isolation über MIG brauchen, für VDI mit Profilen ab 2 GB und für Videoarbeit, die 4:2:2-Encoding braucht. Sie eignet sich für Racks, die durch die Leistung je Rack-Position begrenzt sind, und für Server mit acht Steckplätzen einfacher Breite.

Was wir liefern

Wir liefern die NVIDIA L40S und die RTX PRO 4500 Blackwell Server Edition als Karten für Server, die Sie betreiben, nach einer Kompatibilitätsprüfung von Plattform, Stromversorgung und Kühlung, oder in nach Auftrag gebauten KI-Servern, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Für Modelle, die über 32 oder 48 GB je Karte hinauswachsen, liefern wir die RTX PRO 6000 Server Edition und die H200 NVL. Lizenzen für NVIDIA AI Enterprise und vGPU kommen auf dieselbe Rechnung wie die Hardware. Das gesamte Sortiment an Karten steht auf unserer Seite zu professionellen NVIDIA-GPUs.

FAQ

L40S vs. RTX PRO 4500 Server Edition: Welche Karte ist die richtige für Inferenz?
Die L40S hat 48 GB mit 864 GB/s bei 350 W, die RTX PRO 4500 Server Edition 32 GB mit 800 GB/s bei 165 W; das Tempo für einen Nutzer liegt also nah beieinander, und der Speicher entscheidet. Ein 32B-Modell in FP8 passt nur auf die L40S, während Modelle bis 14B in FP8 auf beide passen und die Server Edition FP4 und MIG mitbringt. In einem 2U-Server mit acht Steckplätzen einfacher Breite ergeben acht Karten der Server Edition 256 GB gegenüber 192 GB bei vier L40S.
Was ist der Nachfolger der NVIDIA L40S?
NVIDIAs Seite zur RTX PRO 6000 Blackwell Server Edition bezeichnet die L40S als Karte der Vorgängergeneration und vergleicht die RTX PRO 6000 Server Edition mit 96 GB mit ihr, während die Seite der RTX PRO 4500 Server Edition diese Karte mit der L4 vergleicht. Für virtuelle PCs nennt NVIDIAs vPC-Sizing-Leitfaden die RTX PRO 4500 Server Edition einen Modernisierungspfad von GPUs der Generation Ada Lovelace (L-Serie). Die Produktseite der L40S nennt keinen Nachfolger, und NVIDIAs vGPU-Liste vom 2. Oktober 2026 führt die L40S als voll unterstützt.
Ist die RTX PRO 4500 Server Edition eine L40S-Alternative mit Blackwell?
Ja, wenn die Modelle in 32 GB je Karte passen und der Server Karten einfacher Breite aufnimmt: Lenovo beschreibt seinen 2U-Server SR650a V4 mit bis zu acht GPUs einfacher oder vier GPUs doppelter Breite und führt die Karte dafür, und die Server Edition nimmt 165 W gegenüber 350 W auf. Sie bringt FP4-Tensor-Kerne, zwei MIG-Instanzen zu 16 GB und PCIe 5.0 mit. Keine Alternative ist sie für ein 32B-Modell in FP8 auf einer Karte, das die 48 GB der L40S oder eine RTX PRO 6000 Server Edition mit 96 GB braucht.
Wie viele RTX PRO 4500 Server Edition passen in einen 2U-Server?
Lenovo Press beschreibt den 2U-Server ThinkSystem SR650a V4 mit bis zu acht GPUs einfacher oder vier GPUs doppelter Breite in den vorderen Steckplätzen, und Lenovos Guide zur Karte vermerkt die Unterstützung im SR650a V4 in seinem Update vom 28. Juli 2026, doch keiner der beiden Guides, die wir gelesen haben, nennt ein Maximum für diese Karte. NVIDIAs vPC-Sizing-Leitfaden geht in seiner Tabelle zur maximalen Dichte von acht Karten je 2U-Server aus, derselben Zahl, die er für die Dual-Slot-Karte L40S angibt, ohne einen Server zu nennen. Die Zahl für ein bestimmtes Servermodell kommt aus dem Konfigurator seines Herstellers für diese Karte.
Unterstützt die RTX PRO 4500 Server Edition MIG und vGPU?
Ja. NVIDIAs MIG-Leitfaden führt zwei Instanzen 1g.16gb je Karte, und NVIDIAs vGPU-Liste führt die Karte ab Release 20.0 mit voller Unterstützung. Die Compute-Typen reichen bis hinunter auf 8 GB mit vier VMs je Karte, und NVIDIAs vPC-Sizing-Leitfaden nennt 16 Desktop-Nutzer je Karte mit 2-GB-Profilen.
Kann die RTX PRO 4500 Server Edition ein 32B-Modell ausführen?
In 4 Bit ja: NVIDIAs NVFP4-Checkpoint von Qwen3-32B hat 19,3 GiB und lässt nach unserer Dimensionierungsregel Platz für etwa vier Gespräche mit 8.192 Token und FP8-Cache bei aktiviertem ECC, sechs bei deaktiviertem. In FP8 hat das Modell 32,0 GiB und passt nicht auf die Karte mit 32 GB. Eine L40S fasst die FP8-Version mit Cache für etwa fünf solche Gespräche bei aktiviertem ECC, acht bei deaktiviertem.

Schicken Sie uns die Modelle und ihre Präzision, die Spitzenzahl gleichzeitiger Gespräche oder vGPU-Plätze und das Servermodell oder die Rack-Position, in die die Karten kommen. Wir antworten innerhalb eines Werktages mit der Karte und ihrer Anzahl je Server, den Lizenzen, die die Konfiguration braucht, und einer Konfiguration mit schriftlichem Angebot.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien