L40S vs. RTX PRO 4500 Server Edition: 48 GB bei 350 W oder 32 GB bei 165 W je Karte
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Die L40S hat 48 GB GDDR6 mit 864 GB/s auf einer Dual-Slot-Karte mit 350 W, die RTX PRO 4500 Blackwell Server Edition 32 GB GDDR7 mit 800 GB/s auf einer Single-Slot-Karte mit 165 W; beide sind passiv gekühlt
- Die Server Edition bringt FP4-Tensor-Kerne, MIG mit zwei Instanzen zu 16 GB, PCIe 5.0 und 4:2:2-Encoding in H.264 und HEVC mit; die L40S hat 73 Prozent mehr CUDA-Kerne und 91,6 gegenüber 51 TFLOPS in FP32
- Nach unserer Dimensionierungsregel passt ein 32B-Modell in FP8 mit Cache für etwa fünf 8K-Gespräche bei aktiviertem ECC, acht bei deaktiviertem, auf eine L40S, aber nicht in 32 GB, während Qwen3-14B in FP8 auf beide Karten passt, für etwa 35 und 13 Gespräche bei aktiviertem ECC
- In einem 2U-Layout mit vier GPU-Steckplätzen doppelter oder acht einfacher Breite, etwa im SR650a V4 von Lenovo, ergeben acht Karten der Server Edition 256 GB GPU-Speicher bei 1.320 W Leistungsaufnahme der Karten, vier L40S 192 GB bei 1.400 W
- NVIDIA stellt die RTX PRO 6000 Server Edition der L40S gegenüber und die RTX PRO 4500 Server Edition der L4, und NVIDIAs vGPU-Liste vom 2. Oktober 2026 führt die L40S und die RTX PRO 4500 Server Edition als voll unterstützt
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
L40S vs. RTX PRO 4500 Server Edition: die kurze Antwort
Die NVIDIA L40S hat 48 GB GDDR6 mit 864 GB/s auf einer Dual-Slot-Karte mit 350 W, die RTX PRO 4500 Blackwell Server Edition 32 GB GDDR7 mit 800 GB/s auf einer Single-Slot-Karte mit 165 W. Wählen Sie die L40S, wenn ein Modell mit seinem Cache mehr als etwa 24 GiB auf einer Karte braucht, zum Beispiel ein 32B-Modell in FP8, oder wenn Sie eine bestehende L40S-Umgebung erweitern. Wählen Sie die RTX PRO 4500 Server Edition, wenn die Modelle in 32 GB passen und der Server Steckplätze einfacher Breite hat: Sie bringt FP4-Tensor-Kerne, zwei MIG-Instanzen zu 16 GB, PCIe 5.0 und 4:2:2-Video-Encoding mit, und ein 2U-Server mit acht Steckplätzen einfacher Breite kann doppelt so viele davon aufnehmen, sofern sein Hersteller die Karte für diese Steckplätze führt.
Technische Daten von L40S und RTX PRO 4500 Server Edition
| SPEZIFIKATION | L40S | RTX PRO 4500 SE |
|---|---|---|
| Architektur | Ada Lovelace | Blackwell |
| CUDA-Kerne | 18.176 | 10.496 |
| GPU-Speicher | 48 GB GDDR6 mit ECC | 32 GB GDDR7 mit ECC, 256 Bit |
| Speicherbandbreite | 864 GB/s | 800 GB/s |
| FP8 Tensor | 733 TFLOPS dicht, 1.466 mit Sparsity | 811 TFLOPS, Basis nicht angegeben |
| FP4 Tensor | keine | 1,6 PFLOPS, Basis nicht angegeben |
| FP32 | 91,6 TFLOPS | 51 TFLOPS |
| Maximale Leistungsaufnahme | 350 W | 165 W |
| Karte | Dual Slot, 4,4 × 10,5 Zoll, passiv | Single Slot, volle Bauhöhe, volle Länge, passiv |
| Host-Schnittstelle | PCIe 4.0 x16 | PCIe 5.0 x16 |
| MIG | nein | bis zu 2 Instanzen zu 16 GB |
| vGPU, erstes Release | 16.1 | 20.0 |
| NVENC und NVDEC | 3 und 3, mit AV1 | 3 und 3, mit 4: |
| NVLink | nein | nein |
NVIDIA-Produktseite der L40S; NVIDIA-Produktseite, Datenblatt (5192801, April 2026) und Product Brief PB-12790-001_02 (20. April 2026) der RTX PRO 4500 Blackwell Server Edition; NVIDIAs Liste der von vGPU unterstützten GPUs, aktualisiert am 2. Oktober 2026.
Die L40S ist der größere Chip, mit 73 Prozent mehr CUDA-Kernen und dem 1,8-Fachen der FP32-Rate, aber nur 8 Prozent mehr Speicherbandbreite. NVIDIA gibt nicht an, ob die 811 TFLOPS FP8 der Server Edition Sparsity einschließen; auf der Seite der L40S ist 733 der dichte Wert und 1.466 der Wert mit Sparsity. Ist NVIDIAs Blackwell-Wert ein Sparsity-Wert, hat die L40S je Karte die höhere FP8-Rate. Je Server kehrt sich die Reihenfolge um: Acht Karten der Server Edition kommen nach unserer Rechnung zusammen auf 6.488 TFLOPS, vier L40S auf 2.932 dicht oder 5.864 mit Sparsity.
Unser Leitfaden zur RTX PRO 4500 Server Edition behandelt die Karte für sich, und unser Review der L40S-Benchmarks die veröffentlichten Messungen der älteren Karte.
Welche Modelle in 32 GB und in 48 GB passen
Wir dimensionieren mit der Regel aus unserem Leitfaden dazu, wie viel VRAM ein LLM braucht: 90 Prozent des Kartenspeichers, abzüglich etwa 3 GiB für Aktivierungen und Laufzeitumgebung, nehmen die Gewichte und den KV-Cache auf. Beide Karten haben ECC-Speicher, der bei GDDR-Karten laut NVIDIAs CUDA C++ Best Practices Guide den verfügbaren Speicher um 6,25 Prozent verringert. Bei aktiviertem ECC bleiben damit etwa 37,3 GiB für Gewichte und Cache auf der L40S und 23,9 GiB auf der RTX PRO 4500 Server Edition, bei deaktiviertem ECC 40,0 und 25,7 GiB; nvidia-smi -q zeigt den ECC-Modus der gelieferten Karte. Der Cache eines Gesprächs ergibt sich aus der config.json des Modells, und mit FP8-Cache bei vollem Kontext von 8.192 Token belegt er 0,5625 GiB für Qwen3-8B, 0,625 GiB für Qwen3-14B und 1 GiB für Qwen3-32B.
| MODELL UND FORMAT | GEWICHTE | L40S | RTX PRO 4500 SE |
|---|---|---|---|
| Qwen3-8B, FP8 | 8,8 GiB | etwa 50 (55) | etwa 26 (30) |
| Qwen3-14B, FP8 | 15,2 GiB | etwa 35 (39) | etwa 13 (16) |
| Qwen3-32B, NVFP4 | 19,3 GiB | keine FP4-Tensor-Kerne | etwa 4 (6) |
| Qwen3-32B, FP8 | 32,0 GiB | etwa 5 (8) | passt nicht |
| Llama 3.3 70B, NVFP4 | 39,8 GiB | kein Platz für Cache | passt nicht |
Gleichzeitige Gespräche mit 8.192 Token je Karte mit FP8-KV-Cache, nach unserer Rechnung, zuerst mit aktiviertem ECC, in Klammern mit deaktiviertem ECC; der Kartenspeicher ist unsere Schätzung dessen, was der Treiber meldet. Gewichte: NVIDIAs FP8- und NVFP4-Checkpoints und Qwens FP8-Version von Qwen3-32B auf Hugging Face, abgerufen am 10. Oktober 2026; Schichten und KV-Heads aus der jeweiligen config.json.
Die Trennlinie bildet ein 32B-Modell in FP8, das mit Platz für etwa fünf Gespräche (acht bei deaktiviertem ECC) auf die L40S passt und nicht auf die Server Edition. Qwens FP8-Version skaliert ihre Gewichte in Blöcken von 128 × 128, ein Format, das die Support-Matrix von TensorRT-LLM für Ada nicht führt, wie unser Review der L40S-Benchmarks anmerkt; prüfen Sie also, ob Ihre Serving-Engine es auf der L40S ausführt. In NVFP4 passt dasselbe Modell auf die Blackwell-Karte, für etwa vier Gespräche (sechs bei deaktiviertem ECC). Ada hat keine FP4-Tensor-Kerne, deshalb führt vLLM NVFP4 auf der L40S nur als Weight-only-Kompression aus, und andere 4-Bit-Modelle laufen als INT4 über AWQ oder GPTQ. Modelle bis 14B in FP8 passen auf beide Karten, und die L40S fasst je Karte mehr als doppelt so viele Qwen3-14B-Gespräche. Das Tempo für einen Nutzer liegt nah beieinander, weil ein dichtes Modell seine Gewichte einmal je Token liest: Für Qwen3-14B in FP8 mit 16,3 GB Gewichten liegt die Obergrenze nach unserer Rechnung bei etwa 53 Token pro Sekunde auf der L40S und 49 auf der Server Edition.
Summen je 2U-Server mit vier oder acht GPU-Steckplätzen
Lenovo Press beschreibt den ThinkSystem SR650a V4, einen 2U-Server, mit „Unterstützung für bis zu 4 GPUs doppelter Breite oder 8 GPUs einfacher Breite, eingebaut in den vorderen Steckplätzen“ (LP2128, aktualisiert am 5. Oktober 2026) und führt „4x NVIDIA L40S 350W GPUs“ unter seinen Merkmalen. Lenovos Guide zur RTX PRO 4500 Server Edition (LP2391) vermerkt in seinem Update vom 28. Juli 2026: „Der SR650a V4 unterstützt die GPU jetzt“. Lenovos eigenes Beispiel mit acht Karten lautet „8x NVIDIA L4 single-wide GPUs“, und keiner der beiden Guides, die wir lesen konnten, nennt, wie viele Karten der RTX PRO 4500 Server Edition der Server aufnimmt. Die Tabelle nutzt dieses Layout als Beispiel; die Zahl der Karten je Server kommt aus dem Konfigurator des Herstellers.
| JE 2U-SERVER | 4 × L40S | 8 × RTX PRO 4500 SE |
|---|---|---|
| GPU-Speicher | 192 GB | 256 GB |
| Leistungsaufnahme, GPUs | 1.400 W | 1.320 W |
| Bandbreite, Summe | 3.456 GB/s | 6.400 GB/s |
| FP32, Summe | 366 TFLOPS | 408 TFLOPS |
| NVENC und NVDEC | 12 und 12 | 24 und 24 |
| MIG-Instanzen | keine | 16 zu 16 GB |
| Qwen3-14B FP8, 8K | etwa 140 (156) | etwa 104 (128) |
| Qwen3-32B FP8, 8K | etwa 20 (32) | passt nicht |
| vPC-Nutzer, maximal | 128 mit 1-GB-Profilen | 128 mit 2-GB-Profilen |
Beispiel-Layout, keine Konfiguration: Steckplätze aus Lenovo Press LP2128; Werte je Karte aus NVIDIAs Produktseiten; Gespräche aus der Tabelle oben, mit aktiviertem und in Klammern deaktiviertem ECC; vPC-Nutzer je Karte aus NVIDIAs vPC-Sizing-Leitfaden, aktualisiert am 19. August 2026. Summen nach unserer Rechnung.
Der Server mit acht Karten hat ein Drittel mehr GPU-Speicher bei etwas geringerer Leistungsaufnahme der Karten, fast die doppelte summierte Bandbreite und doppelt so viele Video-Engines. Jede Karte fasst weniger, deshalb sinkt die Zahl für Qwen3-14B bei aktiviertem ECC von etwa 140 auf 104, und ein 32B-Modell in FP8 muss per Tensor-Parallelität über PCIe auf zwei Karten aufgeteilt werden, da keine der beiden Karten NVLink hat. Bei 8B-Modellen dreht sich die Reihenfolge wieder: etwa 208 Gespräche auf acht Karten der Server Edition gegenüber 200 auf vier L40S bei aktiviertem ECC.
Wir bauen KI-Server mit beiden Karten nach Auftrag und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Nennen Sie uns die Modelle, die Spitzenzahl der Gespräche und den Server oder die Rack-Position, und wir antworten mit der Zahl der Karten je Server.
MIG und vGPU auf der L40S und der RTX PRO 4500 Server Edition
NVIDIAs MIG-Leitfaden, aktualisiert am 11. September 2026, führt bis zu zwei MIG-Instanzen 1g.16gb je Karte RTX PRO 4500 Blackwell, jede mit der Hälfte des Speichers, der Hälfte der SMs und je einer NVENC-, NVDEC- und JPEG-Engine, sowie 2g.32gb für die ganze Karte. Die L40S hat kein MIG und teilt Speicher und Rechenleistung in Zeitscheiben. Nach unserer Dimensionierungsregel fasst jede 16-GB-Instanz Qwen3-8B in FP8 mit Cache für etwa vier 8K-Gespräche bei deaktiviertem ECC oder zwei bei aktiviertem, sodass ein Server mit acht Karten 16 getrennte kleine Modelle mit Hardware-Isolation zwischen ihnen betreiben kann.
Für Compute-VMs führt die vGPU-Referenz von NVIDIA AI Enterprise (Release 8.2, aktualisiert am 2. September 2026) L40S-Typen von L40S-48C bis hinunter zu L40S-4C, also zwölf VMs zu 4 GB je Karte. Der kleinste Compute-Typ der RTX PRO 4500 Server Edition hat 8 GB, vier je Karte, per Time-Slicing als DC-8C oder auf MIG-Basis als DC-2-8C. Im 2U-Beispiel ergibt das 48 Compute-VMs zu 4 GB auf vier L40S und 32 zu 8 GB auf acht Karten der Server Edition.
Für virtuelle Desktops gibt NVIDIAs vPC-Sizing-Leitfaden der Server Edition 16 Nutzer je Karte mit 2-GB-Profilen und kennzeichnet 1-GB-Profile mit „Not supported on Blackwell“; die L40S erreicht 32 Nutzer je Karte mit 1-GB-Profilen. Der Leitfaden fügt hinzu, dass seine Tabelle „die maximal unterstützte Dichte und keinen empfohlenen Einsatzpunkt wiedergibt“. Vier L40S und acht Karten der Server Edition kommen damit auf dieselben 128 Nutzer, und jeder Blackwell-Platz hat den doppelten Framebuffer.
NVIDIAs Lizenzierungsleitfaden hält fest, dass NVIDIA AI Enterprise „pro GPU lizenziert wird“ und dass eine Lizenz „für jede GPU erforderlich ist, die im Server oder in der Workstation installiert ist“, auf dem seine Software läuft; ein Server mit acht Karten, der sie betreibt, braucht also acht Lizenzen, wo ein Server mit vier Karten vier braucht. Virtuelle Desktops werden anders lizenziert: Lenovos Guide zur Karte führt Lizenzen für vPC, vApps und RTX vWS je gleichzeitigem Nutzer (CCU).
Wir liefern beide Karten mit Lizenzen für NVIDIA vGPU und AI Enterprise unter einem EU-Vertrag und auf einer Rechnung. Beschreiben Sie die Zahl der Plätze, die Profilgrößen und den Hypervisor im Formular unten, und wir dimensionieren die Karten je Host.
Video-Engines, Stromversorgung und Luftstrom
Jede Karte hat drei NVENC- und drei NVDEC-Engines, acht Karten bringen also je 24 mit und vier je 12. NVIDIA schreibt, dass die Blackwell-Encoder „neu 4:2:2-Encoding in H.264 und HEVC unterstützen“, und die Seite der L40S nennt AV1-Encoding und -Decoding für ihre Engines.
Unser Leitfaden zu Strom und Kühlung für ein GPU-Rack plant etwa 160 CFM Luftstrom je kW bei 11 °C Temperaturanstieg; das sind nach unserer Rechnung etwa 26 CFM je Karte der Server Edition und 56 CFM je L40S, oder 211 und 224 CFM je Server vor Prozessoren, Arbeitsspeicher und Laufwerken. NVIDIAs Product Brief PB-12790-001_02 gibt für die Server Edition einen Umgebungstemperaturbereich im Betrieb von 10 bis 45 °C an und eine Leistungsgrenze, die sich von 165 W bis hinunter auf 100 W einstellen lässt. Beide Karten haben einen 16-poligen Stromanschluss, der Server mit acht Karten braucht also acht GPU-Stromkabel, und Lenovos Guide zur Karte führt ein Hilfsstromkabel für den SR650a V4.
L40S-Nachfolger und Blackwell-Alternativen: was NVIDIA sagt
Die Produktseite der L40S nennt keinen Nachfolger. NVIDIAs Seite zur RTX PRO 6000 Blackwell Server Edition schreibt, dass die Karte „einen massiven Leistungssprung gegenüber der NVIDIA L40S der Vorgängergeneration“ liefert, ohne Testbedingungen auf der Seite. Die Seite der RTX PRO 4500 Server Edition vergleicht die Karte stattdessen mit der L4 und verspricht „mehr als die 5-fache Leistung der L4-GPU der Vorgängergeneration“, ebenfalls ohne Bedingungen. Für virtuelle PCs nennt NVIDIAs vPC-Sizing-Leitfaden die RTX PRO 4500 Server Edition „einen starken Modernisierungspfad für Kunden, die von früheren Generationen von Rechenzentrums-GPUs wechseln“, und zählt Ada Lovelace (L-Serie) dazu. Unser Vergleich von L40S und RTX PRO 6000 Server Edition behandelt dieses Paar.
Die RTX PRO 4500 Server Edition wird zur Alternative zur L40S, wenn sich das Serverdesign mit ihr ändert: mehr Karten mit 32 GB je Server, mit MIG partitioniert, bei weniger als der halben Leistung je Karte. NVIDIAs vGPU-Supportliste, aktualisiert am 2. Oktober 2026, führt beide Karten mit „Full Support“ und dem Status „Active“.
Wann Sie die L40S oder die RTX PRO 4500 Server Edition wählen sollten
Wählen Sie die L40S, wenn ein Modell mit seinem Cache mehr als etwa 24 GiB auf einer Karte braucht, etwa ein 32B-Modell in FP8, wenn die Arbeitslast auf FP32-Arithmetik setzt oder wenn die Server Steckplätze doppelter Breite haben, die für Karten mit 350 W qualifiziert sind.
Wählen Sie die RTX PRO 4500 Server Edition für viele Modelle bis 14B in FP8 oder 32B in NVFP4, für Embedding- und Reranking-Modelle neben einem Assistenten, für Abteilungen, die Hardware-Isolation über MIG brauchen, für VDI mit Profilen ab 2 GB und für Videoarbeit, die 4:2:2-Encoding braucht. Sie eignet sich für Racks, die durch die Leistung je Rack-Position begrenzt sind, und für Server mit acht Steckplätzen einfacher Breite.
Was wir liefern
Wir liefern die NVIDIA L40S und die RTX PRO 4500 Blackwell Server Edition als Karten für Server, die Sie betreiben, nach einer Kompatibilitätsprüfung von Plattform, Stromversorgung und Kühlung, oder in nach Auftrag gebauten KI-Servern, unter einem EU-Vertrag und auf einer Rechnung, mit Herstellergarantie. Für Modelle, die über 32 oder 48 GB je Karte hinauswachsen, liefern wir die RTX PRO 6000 Server Edition und die H200 NVL. Lizenzen für NVIDIA AI Enterprise und vGPU kommen auf dieselbe Rechnung wie die Hardware. Das gesamte Sortiment an Karten steht auf unserer Seite zu professionellen NVIDIA-GPUs.
FAQ
L40S vs. RTX PRO 4500 Server Edition: Welche Karte ist die richtige für Inferenz?
Was ist der Nachfolger der NVIDIA L40S?
Ist die RTX PRO 4500 Server Edition eine L40S-Alternative mit Blackwell?
Wie viele RTX PRO 4500 Server Edition passen in einen 2U-Server?
Unterstützt die RTX PRO 4500 Server Edition MIG und vGPU?
Kann die RTX PRO 4500 Server Edition ein 32B-Modell ausführen?
Schicken Sie uns die Modelle und ihre Präzision, die Spitzenzahl gleichzeitiger Gespräche oder vGPU-Plätze und das Servermodell oder die Rack-Position, in die die Karten kommen. Wir antworten innerhalb eines Werktages mit der Karte und ihrer Anzahl je Server, den Lizenzen, die die Konfiguration braucht, und einer Konfiguration mit schriftlichem Angebot.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages