GPUs mit 48 GB im Vergleich: RTX 6000 Ada, RTX 5880 Ada, RTX PRO 5000 und L40S für KI
Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software
- Alle vier Karten mit 48 GB haben ECC-Speicher; die RTX PRO 5000 Blackwell hat GDDR7 mit 1.344 GB/s und PCIe 5.0, die RTX 6000 Ada und die RTX 5880 Ada GDDR6 mit 960 GB/s und die L40S GDDR6 mit 864 GB/s, alle drei an PCIe 4.0
- Nur die RTX PRO 5000 hat FP4-Tensor-Kerne und MIG (zwei Instanzen zu 24 GB); die L40S ist mit 350 W die einzige passive Karte, gegenüber 300 W bei der RTX 6000 Ada und der RTX PRO 5000 und 285 W bei der RTX 5880 Ada
- NVIDIA führt vGPU-Unterstützung für die L40S, die RTX 6000 Ada und die RTX 5880 Ada; die einzige RTX PRO 5000 auf NVIDIAs vGPU-Liste ist die Version mit 72 GB
- Nach unserer Sizing-Schätzung fasst eine Karte mit 48 GB bei aktiviertem ECC ein 32B-Modell in FP8 mit Cache für etwa 5 Gespräche mit 8K und ein 14B-Modell für etwa 35 (8 und 39 mit deaktiviertem ECC); ein 70B-Modell in FP8 braucht zwei Karten
- Für 4 bis 8 Karten in einem Rack-Server passt die passive L40S zum Luftstrom des Gehäuses; die drei aktiv gekühlten Karten eignen sich für Workstations, wo die RTX PRO 5000 die meiste Bandbreite bringt
Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut Konfiguration anfragen →
GPUs mit 48 GB im Vergleich: was sich außer dem Speicher unterscheidet
Vier NVIDIA-Grafikkarten, die wir liefern, haben 48 GB Speicher: die RTX 6000 Ada Generation, die RTX 5880 Ada Generation, die RTX PRO 5000 Blackwell in der Version mit 48 GB und die L40S. Alle vier haben 48 GB mit ECC, sie fassen also dieselben Modelle und unterscheiden sich in dem, was den Speicher umgibt. Die RTX PRO 5000 hat GDDR7 mit 1.344 GB/s, PCIe 5.0, FP4-Tensor-Kerne und MIG mit zwei Instanzen. Die drei Ada-Karten haben GDDR6 mit 960 GB/s (RTX 6000 Ada und RTX 5880 Ada) oder 864 GB/s (L40S), PCIe 4.0 und kein MIG. Die L40S ist die einzige passive Karte der vier, gebaut für den Luftstrom eines Servers und mit 350 W, während die anderen drei aktive Kühler für Workstations haben und 285 bis 300 W aufnehmen.
Bei einer GPU mit 48 GB, auf der ein LLM läuft, setzt die Speicherbandbreite die Obergrenze für das Tempo jedes Gesprächs, und der Speicher, der neben den Gewichten frei bleibt, bestimmt, wie viele Gespräche passen. Die RTX PRO 5000 liest ihren Speicher 1,4-mal so schnell wie die beiden Ada-Workstation-Karten und etwa 1,56-mal so schnell wie die L40S. Für virtuelle Maschinen ändert sich die Reihenfolge: NVIDIA führt vGPU-Unterstützung für die drei Ada-Karten, während die einzige RTX PRO 5000 auf NVIDIAs vGPU-Liste die Version mit 72 GB ist.
48-GB-GPU-Vergleich: die Spezifikationen nebeneinander
| KARTE | SPEICHER, BANDBREITE | TENSOR-KERNE | LEISTUNG, KÜHLUNG | MIG, VGPU |
|---|---|---|---|---|
| RTX 6000 Ada | 48 GB GDDR6, 960 GB/s | 4. Generation, FP8 | 300 W, aktiv | kein MIG; vGPU ab 15.2 |
| RTX 5880 Ada | 48 GB GDDR6, 960 GB/s | 4. Generation, FP8 | 285 W, aktiv | kein MIG; vGPU ab 17.0 |
| RTX PRO 5000, 48 GB | 48 GB GDDR7, 1.344 GB/s | 5. Generation, zusätzlich FP4 | 300 W, aktiv | 2 × 24 GB; keine vGPU |
| L40S | 48 GB GDDR6, 864 GB/s | 4. Generation, FP8 | 350 W, passiv | kein MIG; vGPU ab 16.1 |
Datenblätter und Produktseiten von NVIDIA: RTX 6000 Ada (Datenblatt vom Februar 2023), RTX 5880 Ada (Datenblatt 3082478, Dezember 2023), RTX PRO 5000 Blackwell (Datenblatt vom Juli 2026), Produktseite der L40S; NVIDIAs MIG-Leitfaden (11. September 2026) und Liste der von vGPU unterstützten GPUs (2. Oktober 2026), gelesen am 10. Oktober 2026. Spalte vGPU: erstes Release der vGPU-Software, das die Karte unterstützt.
Für die RTX 6000 Ada und die L40S nennt NVIDIA je 18.176 CUDA-Kerne und 568 Tensor-Kerne, für die RTX 5880 Ada 14.080 und 440. Auch die RTX PRO 5000 hat laut NVIDIA 14.080 CUDA-Kerne, aus der Blackwell-Generation. NVIDIA gibt die FP32-Leistung mit 91,1 TFLOPS bei der RTX 6000 Ada an, mit 91,6 bei der L40S, 69,3 bei der RTX 5880 Ada und 65 bei der RTX PRO 5000.
Die Spitzenwerte der Tensor-Kerne sind auf unterschiedlicher Basis veröffentlicht. NVIDIA gibt die RTX 6000 Ada mit 1.457 TFLOPS an, die L40S mit 1.466 und die RTX 5880 Ada mit 1.108,4, jeweils in FP8 mit Sparsity. Für die RTX PRO 5000 nennt NVIDIA 2.064 AI TOPS, die das Datenblatt als FP4 mit Sparsity definiert. Neben die drei FP8-Werte gestellt, überzeichnet ein FP4-Spitzenwert den Unterschied zwischen den Generationen.
Die drei Ada-Karten haben vier Ausgänge DisplayPort 1.4a, die RTX PRO 5000 vier DisplayPort 2.1b. Alle sind Dual-Slot-Karten mit 4,4 × 10,5 Zoll. Laut ihren Datenblättern haben die RTX 6000 Ada und die RTX 5880 Ada kein NVLink, und für die L40S und die RTX PRO 5000 führt NVIDIA keines; ein auf zwei Karten aufgeteiltes Modell tauscht seine Daten also über PCIe aus.
Was eine GPU mit 48 GB für LLMs fasst
Unser Leitfaden dazu, wie viel VRAM ein LLM braucht, erklärt die Methode; hier wenden wir seine Regel auf 48 GB an. Wir nehmen 90 Prozent des Speichers, den der Treiber meldet, ziehen 3 GiB für Aktivierungen und Laufzeitumgebung ab, dann die Gewichte, und teilen den Rest durch den KV-Cache eines Gesprächs in FP8 bei vollem 8K-Kontext: 0,625 GiB für Qwen3-14B, 1 GiB für Qwen3-32B und 1,25 GiB für Llama 3.3 70B.
ECC verändert den Ausgangswert. NVIDIAs CUDA C++ Best Practices Guide hält fest: „Auf GPUs mit GDDR-Speicher und aktiviertem ECC verringert sich der verfügbare DRAM um 6,25 %, damit die ECC-Bits gespeichert werden können.“ Mit deaktiviertem ECC schätzen wir 47,8 GiB je Karte, anteilig zu den 95,6 GiB, die der Treiber bei einer 96-GB-Karte meldet, wie in unserem Vergleich der RTX PRO 5000; mit aktiviertem ECC etwa 44,8 GiB. Die Tabelle nennt beide Werte, und nvidia-smi -q zeigt den ECC-Modus und den Speicher der gelieferten Karte.
| MODELL UND PRÄZISION | GEWICHTE | EINE 48-GB-KARTE | ZWEI KARTEN, GETEILT |
|---|---|---|---|
| Qwen3-14B, FP8 | 15,2 GiB | etwa 35 (39) | nicht nötig |
| Qwen3-32B, FP8 | 32,0 GiB | etwa 5 (8) | etwa 42 (48) |
| Llama 3.3 70B, NVFP4 | 39,8 GiB | kein Platz für eines | etwa 27 (32) |
| Llama 3.3 70B, FP8 | 67,7 GiB | passt nicht | etwa 5 (9) |
Unsere Schätzungen. Gespräche bei vollem 8K-Kontext in einem FP8-KV-Cache, zuerst mit aktiviertem ECC (44,8 GiB je Karte), in Klammern mit deaktiviertem ECC (47,8 GiB). Gewichte aus den FP8-Checkpoints von Qwen für Qwen3-14B und Qwen3-32B und aus NVIDIAs FP8- und FP4-Checkpoints von Llama 3.3 70B auf Hugging Face; zwei Karten mit Tensor-Parallelismus, Cache über beide zusammengefasst.
Die Gewichte sind ein fester Posten je Kopie des Modells, die Zahl je Karte sinkt also schnell, wenn die Modelle wachsen. Nach derselben Regel fasst eine RTX PRO 6000 mit 96 GB etwa 51 Gespräche mit Qwen3-32B in FP8, gegenüber 5 bis 8 auf einer Karte mit 48 GB. Die Tabelle zählt nur den Speicher, nicht die Formate, die jede Karte berechnet; NVFP4 läuft auf den FP4-Tensor-Kernen der RTX PRO 5000, und für die Ada-Karten sollten Sie prüfen, ob Ihre Serving-Engine das 4-Bit-Format des Checkpoints unterstützt, den Sie einsetzen wollen.
Speicherbandbreite, FP4 und Messergebnisse
Bei einem dichten Modell liest jedes neue Token eines Gesprächs alle Gewichte einmal, die Bandbreite begrenzt also das Tempo eines einzelnen Streams, wenn das Modell passt. Mit 1.344 GB/s gegenüber 960 und 864 GB/s hat die RTX PRO 5000 bei jedem Modell der Tabelle oben die höhere Obergrenze. Mit vielen Gesprächen in einem Batch arbeiten die Karten näher an ihren Rechengrenzen, und die Werte der Tensor-Kerne oben fallen stärker ins Gewicht.
Puget Systems hat in seinem Überblick über professionelle GPUs vom 18. Dezember 2025 die RTX PRO 5000 mit 48 GB und die RTX 6000 Ada im selben Desktop-System getestet: In V-Ray GPU schlug die RTX PRO 5000 laut Puget „sogar die 6000 Ada um 11 %“, und in Topaz Video AI lag sie 8 Prozent vorn. Die RTX 5880 Ada und die L40S waren nicht Teil dieses Tests. Für Sprachmodelle haben wir keinen veröffentlichten Test gefunden, der alle vier Karten mit derselben Engine, derselben Präzision und derselben Zahl gleichzeitiger Anfragen fährt. NVIDIAs NIM-Tabellen für die L40S mit Token-Raten bei 1 bis 250 gleichzeitigen Anfragen stehen in unserem Artikel zu veröffentlichten Benchmarks der L40S.
MIG und vGPU auf Karten mit 48 GB
MIG teilt eine Karte in Instanzen mit eigenem Speicher und eigener Rechenleistung. Von den vier unterstützt es nur die RTX PRO 5000: NVIDIAs MIG-Leitfaden führt die 48-GB-Karte mit höchstens zwei Instanzen, und das Datenblatt gibt sie mit je 24 GB an. Jede Hälfte fasst Qwen3-14B in FP8, nach unserer Regel aber mit Cache für nur etwa 3 bis 5 Gespräche mit 8K; die Teilung eignet sich also für zwei kleine Teams oder für eine Entwicklungs- und eine Testinstanz. Die Umstellung in den Compute-Modus schaltet die Displayausgänge der Karte ab; unser Vergleich der RTX PRO 5000 mit 48 GB und 72 GB nennt die Treiber- und Tool-Versionen, die dafür nötig sind. Die RTX 6000 Ada, die RTX 5880 Ada und die L40S haben kein MIG und teilen eine Karte in Zeitscheiben zwischen virtuellen Maschinen.
Für vGPU zeigt NVIDIAs Liste der unterstützten GPUs vom 2. Oktober 2026 die RTX 6000 Ada ab Release 15.2, die L40S ab 16.1 und die RTX 5880 Ada ab 17.0, jeweils mit voller Unterstützung. Die RTX PRO 5000 mit 48 GB steht nicht auf der Liste, die Version mit 72 GB schon, ab Release 20.2. NVIDIA fügt hinzu, dass „die GPU-Unterstützung auch von der verwendeten Hypervisor-Software abhängen kann“; prüfen Sie also die Support-Matrix Ihres vGPU-Releases für Ihren Hypervisor. Bei der RTX 6000 Ada und der RTX 5880 Ada sind die Displayanschlüsse standardmäßig aktiv, und laut NVIDIAs Seiten sind sie abzuschalten, wenn die vGPU-Software genutzt wird.
GPUs mit 48 GB im KI-Server: vier bis acht Karten
Ein Rack-Server kühlt seine GPUs mit den Lüftern des Gehäuses, und passive Rechenzentrumskarten wie die L40S sind für diesen Luftstrom gebaut. NVIDIA gibt die L40S mit 350 W an, vier Karten ziehen also 1,4 kW und acht 2,8 kW, noch ohne Prozessoren und Lüfter. Eine aktiv gekühlte Workstation-Karte gehört nur dann in einen Rack-Server, wenn der Serverhersteller diese Karte für dieses Gehäuse listet; prüfen Sie also die GPU-Kompatibilitätsliste des Herstellers, bevor Sie vier oder mehr Karten vom Typ RTX 6000 Ada, RTX 5880 Ada oder RTX PRO 5000 in einem Server planen.
Als Rechenbeispiel dient ein interner Assistent auf Qwen3-14B in FP8 für 1.000 Mitarbeiter, mit einer Spitze von 130 gleichzeitig laufenden Gesprächen bei 8K. Nach der Regel oben fasst eine L40S mit aktiviertem ECC etwa 35, ein Server mit vier L40S und einer Kopie des Modells je Karte also etwa 140. Zwei solche Server fassen etwa 280, und fällt einer aus, deckt der andere die Spitze weiterhin ab. Ein 70B-Modell in FP8 läuft auf denselben Servern als eine Kopie, mit Tensor-Parallelismus über PCIe auf vier Karten verteilt, nach unserer Rechnung mit Cache für etwa 65 Gespräche je Kopie (73 mit deaktiviertem ECC); für mehr Nutzer je Karte sind die Karten mit 96 GB und 141 GB in unserem Sortiment der nächste Schritt.
Wir bauen KI-Server auf Bestellung mit vier bis acht L40S und prüfen Rack, Strom und Luftstrom vor dem Angebot. Schicken Sie uns das Modell, die Spitzenzahl der Gespräche und den Rack-Platz über das Formular unten.
GPUs mit 48 GB in Workstations
Die drei aktiv gekühlten Karten sind für Workstations gebaut. Mit 285 bis 300 W je Karte ziehen vier Karten bis zu 1,2 kW, was die Größe des Netzteils und den Luftstrom durch das Gehäuse bestimmt.
Für LLM-Entwicklung und lokale Inferenz hat die RTX PRO 5000 die meiste Bandbreite der drei, FP4 für NVFP4-Checkpoints und MIG für zwei isolierte Nutzer je Karte. Die RTX 6000 Ada und die RTX 5880 Ada passen zu einem Bestand an Workstations, der auf die Ada-Generation standardisiert ist, und zu Arbeitslasten, die vGPU auf einer Karte der Workstation-Klasse brauchen. Wo ein Anwendungshersteller bestimmte Karten zertifiziert, entscheidet seine Liste. Die RTX 5880 Ada hat denselben Speicher und dieselbe Bandbreite wie die RTX 6000 Ada, mit weniger Kernen und 15 W weniger Leistungsaufnahme; unser Vergleich der RTX 5880 Ada mit der RTX 6000 Ada behandelt den Unterschied im Detail, und der Vergleich der RTX 6000 Ada mit der L40S dieselbe Kernkonfiguration als Workstation- und als Serverkarte.
Für einen Bestand von acht Workstations für Rendering oder Simulation sprechen die Puget-Werte oben in V-Ray GPU für die RTX PRO 5000. Für CAD-Arbeitsplätze vergleichen Sie die Größe Ihrer größten Baugruppen und Szenen mit 48 GB, bevor Sie diese Klasse statt einer kleineren Karte wählen.
Wir liefern alle drei Workstation-Karten unter einem EU-Vertrag und auf einer Rechnung. Nennen Sie uns, wie viele Workstations Sie ausstatten und was auf jeder läuft.
Welche GPU mit 48 GB für welche Maschine
| MASCHINE, WORKLOAD | KARTE | GRUND |
|---|---|---|
| Rack-Server, LLM-Inferenz | L40S | passive Kühlung für den Luftstrom des Gehäuses, vGPU-Unterstützung |
| Rack-Server, VMs mit vGPU | L40S | zeitgeteilte vGPU ab Release 16.1 |
| Workstation, LLM-Entwicklung | RTX PRO 5000 | 1.344 GB/s, FP4, MIG mit zwei Instanzen zu 24 GB |
| Workstation, zwei Nutzer | RTX PRO 5000 | MIG, als einzige der vier |
| Bestand einheitlich auf Ada | RTX 6000 Ada oder RTX 5880 Ada | gleiche Generation, vGPU auf der Liste |
| Rendering in V-Ray GPU | RTX PRO 5000 | in Pugets Test 11 Prozent vor der RTX 6000 Ada |
| 70B-Modell in FP8 | zwei Karten oder eine größere Karte | passt nicht auf eine Karte mit 48 GB |
Unsere Lesart von NVIDIAs Datenblättern, MIG-Leitfaden und vGPU-Liste (gelesen am 10. Oktober 2026) und von Puget Systems’ Überblick vom 18. Dezember 2025.
Was wir liefern
Wir liefern die RTX 6000 Ada, die RTX 5880 Ada, die RTX PRO 5000 Blackwell und die L40S mit Herstellergarantie, unter einem EU-Vertrag und auf einer Rechnung, als Einzelkarten oder in KI-Servern, die wir auf Bestellung bauen. Wir bauen Server rund um den Workload, montiert und im Burn-in getestet, und Konfiguration und Angebot folgen innerhalb eines Werktages. Für Modelle, die über 48 GB hinauswachsen, setzt sich das Sortiment auf unserer GPU-Seite mit der RTX PRO 5000 mit 72 GB, der RTX PRO 6000 mit 96 GB und der H200 NVL mit 141 GB fort. Lizenzen für NVIDIA AI Enterprise und vGPU kommen auf dieselbe Rechnung wie die Karten.
FAQ
Welche GPU mit 48 GB VRAM eignet sich für LLM-Inferenz?
RTX 6000 Ada vs RTX PRO 5000: Welche ist schneller?
Welches LLM passt auf eine GPU mit 48 GB VRAM?
Reicht eine GPU mit 48 GB für ein 70B-Modell?
Welche GPUs mit 48 GB unterstützen MIG und vGPU?
Kann ich eine RTX 6000 Ada oder RTX PRO 5000 in einen GPU-Server einbauen?
Schicken Sie uns das Modell und seine Präzision, die Spitzenzahl der Gespräche, wie viele Server oder Workstations Sie planen, und die Stromzuleitung am Rack-Platz. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem schriftlichen Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.
Mit einem Experten sprechenWir antworten innerhalb eines Werktages