BLOG · VERGLEICH ·

GPU-TFLOPS-Vergleich: FP4, FP8 und BF16 je Karte, dicht und mit Sparsity, und was 4 PFLOPS FP8 je Server bedeuten

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • NVIDIA gibt die meisten Werte der Tensor-Kerne mit 2:4-Sparsity an; der dichte Wert, den gewöhnliche Modellgewichte nutzen, ist halb so hoch, die 1.671 BF16- und 3.341 FP8-TFLOPS der H200 NVL sind also 835,5 und 1.670,5 dicht
  • Die Seite der RTX PRO 6000 Server Edition nennt 4 PFLOPS FP4, 2 FP8 und 1 BF16 ohne Angabe zur Sparsity; die Werte entsprechen gerundet den Sparsity-Werten der Workstation Edition, deren dichter FP8-Wert 1.007,6 TFLOPS beträgt
  • Die FP8- oder FP4-PFLOPS eines Servers sind der Kartenwert mal die Zahl der Karten: Zwei Karten der RTX PRO 6000 Server Edition ergeben laut Angabe 4 PFLOPS FP8; sind diese Werte Sparsity-Werte, braucht es nach unserer Rechnung vier für dichte 4 PFLOPS
  • Für DGX Spark veröffentlicht NVIDIA einen einzigen Rechenwert, bis zu 1 PFLOP FP4 mit Sparsity, und keinen Wert für BF16, FP8 oder FP32; sein GB10-Chip hat die Compute Capability 12.1
  • NVIDIAs CUDA-Liste gibt der H200 die Compute Capability 9.0, jeder RTX-PRO-Blackwell-Karte 12.0 und der RTX 6000 Ada, L40S und L4 8.9; nur die Blackwell-Karten führen FP4, und die H200 NVL nennt 30 TFLOPS FP64, wo die Chips der RTX PRO 6000 Workstation und RTX 6000 Ada FP64 mit 1/64 der FP32-Rate rechnen

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

GPU-TFLOPS im Vergleich: Werte mit Sparsity und dichte Werte

NVIDIA gibt die meisten Werte der Tensor-Kerne „mit Sparsity“ an, also als Rate, die mit Gewichten rechnet, die auf ein 2:4-Muster beschnitten sind; der dichte Wert, den gewöhnliche Modellgewichte nutzen, ist halb so hoch. Die 1.671 BF16-TFLOPS und 3.341 FP8-TFLOPS der H200 NVL entsprechen deshalb 835,5 und 1.670,5 TFLOPS dicht. Die FP8- oder FP4-PFLOPS eines Servers sind der Kartenwert mal die Zahl der Karten. Zwei Karten der RTX PRO 6000 Server Edition mit je 2 PFLOPS FP8 ergeben auf dem Papier einen GPU-Server mit 4 PFLOPS FP8. NVIDIA sagt nicht, ob diese 2 PFLOPS mit Sparsity gelten; ist das der Fall, liegt der dichte Wert bei etwa der Hälfte.

Die Tabellen unten nennen FP4, FP8, BF16, FP32 und FP64 für jede Karte, die wir liefern, und für DGX Spark, so wie NVIDIAs Datenblätter, Produktseiten und Architektur-Whitepaper sie angeben, gelesen am 10. Oktober 2026. Jeder Wert ist als Sparsity-Wert oder dicht gekennzeichnet, wo NVIDIA ihn so kennzeichnet, und die Compute Capability stammt aus NVIDIAs CUDA-GPU-Liste.

Tensor-TFLOPS je Karte: FP4, FP8 und BF16

KARTEFP4 TENSORFP8 TENSORBF16 TENSORANGEGEBENE BASIS
H200 NVLkein FP43.3411.671mit Sparsity
RTX PRO 6000 Server Edition4 PFLOPS2 PFLOPS1 PFLOPnicht angegeben
RTX PRO 6000 Workstation4.030,4 / 2.015,22.015,2 / 1.007,61.007,6 / 503,8Sparsity / dicht
RTX PRO 5000 (48 und 72 GB)2.064nicht genanntnicht genanntmit Sparsity
RTX PRO 45001.617nicht genanntnicht genanntmit Sparsity
RTX PRO 4500 Server Edition1,6 PFLOPS811406nicht angegeben
RTX PRO 40001.178nicht genanntnicht genanntmit Sparsity
RTX PRO 2000545nicht genanntnicht genanntmit Sparsity
RTX 6000 Adakein FP41.457 / 728,5728 / 364Sparsity / dicht
RTX 5880 Adakein FP41.108,4nicht genanntmit Sparsity
L40Skein FP41.466 / 733733 / 362,05Sparsity / dicht
L4kein FP4485242mit Sparsity
DGX Spark (GB10)bis zu 1 PFLOPnicht veröffentlichtnicht veröffentlichtmit Sparsity

TFLOPS, sofern nicht anders angegeben. NVIDIA-Produktseiten der H200 (gekennzeichnet als „Preliminary specifications“), L40S, L4, RTX 6000 Ada und beider Server Editions; RTX-PRO-Datenblätter 5349550 (5000), 5108623 (4500), 5323450 (4000) und 5322351 (2000), deren FP4-Wert in „AI TOPS“ angegeben ist; Architektur-Whitepaper zur RTX Blackwell PRO v1.1, Tabelle 4; Datenblatt der RTX 5880 Ada 3082478; Hardware-Übersicht des DGX Spark, aktualisiert am 10. September 2026; alle gelesen am 10. Oktober 2026.

Die Datenblätter der RTX-PRO-Blackwell-Workstation-Karten nennen einen einzigen Tensor-Wert in AI TOPS und erläutern ihn in der Fußnote als „Effective FP4 TOPS with sparsity“; das Datenblatt der RTX PRO 4000 schreibt „Theoretical FP4 TOPS using the sparsity feature“. Für die RTX PRO 5000, 4500, 4000 und 2000 veröffentlicht NVIDIA keinen FP8- oder BF16-Wert, und Tabelle 4 des Whitepapers deckt nur die RTX PRO 6000 Workstation und Max-Q ab. Bei deren GB202-Chip verdoppelt jede Halbierung der Bits die Rate: Die Workstation Edition schafft 503,8 dichte TFLOPS in BF16, 1.007,6 in FP8 und 2.015,2 in FP4, und ihr Datenblatt rundet den FP4-Wert mit Sparsity auf 4.000 AI TOPS. Die Seite der RTX PRO 4500 Server Edition zeigt dieselben Stufen, 1,6 PFLOPS, 811 und 406 TFLOPS. Behalten die kleineren Karten diese Stufung von 4 zu 2 zu 1 bei, ist dichtes FP8 ein Viertel des AI-TOPS-Werts: etwa 516 TFLOPS bei der RTX PRO 5000, 404 bei der RTX PRO 4500, 295 bei der RTX PRO 4000 und 136 bei der RTX PRO 2000. Das ist unsere Rechnung, keine Angabe von NVIDIA.

Die Ada-Karten nennen FP8 als Hauptwert. Die Produktseite der RTX 6000 Ada erläutert ihre 1.457 AI TOPS in der Fußnote als „Theoretical FP8 TOPS using the sparsity feature“. Die Produktseite der RTX 5880 Ada zeigt 1.108,4 Tensor-TFLOPS nur mit einer Fußnote zum Boost-Takt, und NVIDIAs Datenblatt kennzeichnet denselben Wert als effektives FP8 mit Sparsity, halbiert 554,2 dicht. Für die L4 ergänzt NVIDIA „Specifications are one-half lower without sparsity“, ihr dichter FP8-Wert liegt also bei 242,5 TFLOPS.

Sparsity-Werte der Tensor-Kerne und wann sie gelten

NVIDIAs strukturierte Sparsity verlangt Gewichte in einem festen Muster, das NVIDIAs Blog vom 20. Juli 2021 so beschreibt: „In jedem zusammenhängenden Block aus vier Werten müssen zwei Werte null sein.“ Die Sparse Tensor Cores überspringen dann die Nullen und „können dieselbe effektive Berechnung in der halben Zeit erledigen“. Den Weg zu solchen Gewichten beschreibt NVIDIA als Trainingsablauf: ein dichtes Netz auf das 2:4-Muster beschneiden und dann „das ursprüngliche Trainingsverfahren wiederholen“. Checkpoints, die in BF16, FP8 oder NVFP4 heruntergeladen werden, sind dicht, sofern ihr Herausgeber sie nicht auf diese Weise beschnitten hat; für den Vergleich zählt daher die Spalte der dichten Werte. Unser Leitfaden zu FP8, NVFP4, MXFP4 und INT4 erklärt die Formate und welche Tensor-Kerne sie rechnen.

Zwei Produktseiten nennen keine Basis. Die Seite der RTX PRO 6000 Server Edition führt 4 PFLOPS FP4, 2 PFLOPS FP8 und 1 PFLOP BF16 ohne Fußnote, und ihr Datenblatt (4682150, Dezember 2025) nennt nur „4 PFLOPS“ FP4-Spitzenleistung, ohne Sparsity zu erwähnen. Diese Werte entsprechen gerundet den Sparsity-Werten der Workstation Edition von 4.030,4, 2.015,2 und 1.007,6 TFLOPS, doch NVIDIA sagt nicht, welche Basis sie verwenden. Sind es Sparsity-Werte, liegt der dichte FP8-Wert der Server Edition nach unserer Rechnung bei etwa 1 PFLOPS, und die Servertabelle weiter unten kennzeichnet jeden Wert, der auf dieser Annahme beruht. Auch die Seite der RTX PRO 4500 Server Edition nennt 1,6 PFLOPS FP4 ohne Basis; die Workstation-Karte RTX PRO 4500 mit denselben 51 TFLOPS FP32 hat 1.617 AI TOPS, die NVIDIA als Sparsity-Wert kennzeichnet.

FP32, FP64 und Compute Capability je Karte

FP32 meint hier die Single-Precision-Rate der CUDA-Kerne ohne Tensor-Kerne, die Simulation, Rendering und viele wissenschaftliche Codes nutzen. FP64 entscheidet die Kartenwahl für Solver, die doppelte Genauigkeit brauchen.

KARTEFP32 TFLOPSFP64 TFLOPSCOMPUTE CAPABILITY
H200 NVL6030, 60 auf Tensor-Kernen9.0
RTX PRO 6000 Server Edition120nicht genannt12.0
RTX PRO 6000 Workstation125 (Whitepaper 126,0)1/64 von FP3212.0
RTX PRO 5000 (48 und 72 GB)65nicht genannt12.0
RTX PRO 450051nicht genannt12.0
RTX PRO 4500 Server Edition51nicht genannt12.0
RTX PRO 400037nicht genannt12.0
RTX PRO 200017nicht genannt12.0
RTX 6000 Ada91,11/64 von FP328.9
RTX 5880 Ada69,3nicht genanntnicht in der Liste
L40S91,6nicht genannt8.9
L430,3nicht genannt8.9
DGX Spark (GB10)nicht veröffentlichtnicht veröffentlicht12.1

Produktseiten und Datenblätter wie in der ersten Tabelle; FP64-Verhältnisse aus NVIDIAs Architektur-Whitepapern zu RTX Blackwell PRO (v1.1) und Ada (v2.02); Compute Capability aus developer.nvidia.com/cuda-gpus, gelesen am 10. Oktober 2026, das die H200 ohne eigenen NVL-Eintrag führt.

Beide Whitepaper halten fest: „Die FP64-TFLOP-Rate beträgt 1/64 der TFLOP-Rate von FP32-Operationen“, für den GB202-Chip der RTX PRO 6000 Workstation und Max-Q und den AD102-Chip der RTX 6000 Ada. Die Server Edition deckt das Whitepaper nicht ab; behält sie das Verhältnis des GB202 bei, ergeben ihre 120 TFLOPS FP32 nach unserer Rechnung etwa 1,9 TFLOPS FP64, gegenüber 30 TFLOPS bei der H200 NVL. NVIDIAs CUDA-Liste nennt die Compute Capability 9.0 für die H200, 12.0 für jede RTX-PRO-Blackwell-Karte einschließlich beider Server Editions, 12.1 für den GB10 und 8.9 für die RTX 6000 Ada, L40S und L4. FP4-Raten erscheinen nur bei den Blackwell-Karten, und das Whitepaper führt die FP4-Rate der RTX 6000 Ada als „N/A“.

DGX Spark FLOPS: 1 PFLOP FP4 und kein BF16-Wert

NVIDIAs Hardware-Übersicht des DGX Spark, aktualisiert am 10. September 2026, nennt „bis zu 1 PFLOP (PetaFLOP) bei FP4-Präzision mit Sparsity“ und „bis zu 1.000 TOPS (Billionen Operationen pro Sekunde) Inferenz“, mit 6.144 CUDA-Kernen und Tensor-Kernen der fünften Generation. Die Produktseite führt „Up to 1 PFLOP FP4“ und keinen Wert für BF16, FP8 oder FP32. Halbiert ergibt der Sparsity-Wert nach unserer Rechnung etwa 500 TFLOPS dichtes FP4. Einen BF16-Wert leiten wir für den Spark nicht ab, weil NVIDIA für den GB10 kein Verhältnis zwischen den Präzisionen veröffentlicht. Die Token-Generierung auf dem Spark folgt seiner Speicherbandbreite von 273 GB/s und nicht diesen FLOPS, wie unser Artikel mit Benchmarks des DGX Spark anhand veröffentlichter Messungen zeigt.

TFLOPS für Prompts und Training, Bandbreite für die Token-Generierung

NVIDIAs Blog zur Optimierung der LLM-Inferenz vom 17. November 2023 beschreibt die Prefill-Phase, die den Prompt liest, als „eine Matrix-Matrix-Operation, die hochgradig parallelisiert ist“ und die „die GPU-Auslastung effektiv sättigt“. Für die Erzeugung von Token heißt es dort: „Dies ist eine speichergebundene Operation.“ Die TFLOPS der Tensor-Kerne bestimmen deshalb das Tempo bei langen Prompts wie RAG-Anfragen mit abgerufenen Passagen, bei großen Batches gleichzeitiger Anfragen und bei Schritten von Training und Fine-Tuning. Die Speicherbandbreite bestimmt die Token pro Sekunde, die jeder Nutzer sieht. Die H200 NVL hat die 1,66-fache dichte FP8-Rate der RTX PRO 6000 Workstation Edition, 1.670,5 gegenüber 1.007,6 TFLOPS, aber die 2,7-fache Bandbreite, 4,8 TB/s gegenüber 1.792 GB/s. Unser Vergleich der GPU-Speicherbandbreite nennt die Bandbreite jeder Karte, und unser Vergleich von H200 NVL und RTX PRO 6000 für Fine-Tuning wendet die Tensor-Raten auf Trainingsläufe an.

Was 4 PFLOPS FP8 für einen Server mit 4 oder 8 Karten bedeuten

Ein genanntes „4 PFLOPS FP8“ ist ein Kartenwert mal eine Kartenzahl, und Präzision und Basis gehören zu dieser Angabe. NVIDIAs H200-Seite zeigt in den Kurzdaten „4 PetaFLOPS“ FP8; ihre vollständige Tabelle nennt 3.958 TFLOPS mit Sparsity für die H200 SXM und 3.341 für die H200 NVL, 4 PFLOPS liegen also zwischen einer und zwei H200 NVL. Nach NVIDIAs Angaben erreichen zwei Karten der RTX PRO 6000 Server Edition 4 PFLOPS FP8; sind diese Werte Sparsity-Werte, braucht es für dichte 4 PFLOPS vier.

SERVERFP8 LAUT ANGABEFP8 DICHTBF16 DICHTFP4 LAUT ANGABE
4 × RTX PRO 6000 Server8etwa 4, falls Sparsityetwa 2, falls Sparsity16
8 × RTX PRO 6000 Server16etwa 8, falls Sparsityetwa 4, falls Sparsity32
4 × H200 NVL13,46,73,3kein FP4
8 × H200 NVL26,713,46,7kein FP4
8 × L40S11,75,92,9kein FP4
8 × RTX PRO 4500 Server6,5etwa 3,2, falls Sparsityetwa 1,6, falls Sparsity12,8

PFLOPS je Server, unsere Rechnung aus den Kartenwerten der ersten Tabelle (Kartenzahl × Wert; dicht = Hälfte des Sparsity-Werts). „Falls Sparsity“ kennzeichnet Werte der Server Editions, die annehmen, dass NVIDIAs nicht gekennzeichnete Werte Sparsity-Werte sind, was NVIDIA nicht angibt. Spitzenraten, kein gemessener Durchsatz.

In dichtem FP8 erreichen acht H200 NVL 13,4 PFLOPS, gegenüber etwa 8 für acht Karten der RTX PRO 6000 Server Edition, falls deren angegebene Werte Sparsity-Werte sind. Mit FP4-Gewichten führt der RTX-PRO-Server 32 PFLOPS, während NVIDIA für die H200 NVL keine FP4-Rate nennt, und vLLM rechnet FP4-Checkpoints dort mit 16-Bit-Arithmetik, wie unser Formate-Leitfaden erklärt. Diese Summen sind Spitzenwerte beim Boost-Takt und setzen voraus, dass jede Karte an ihrem eigenen Anteil arbeitet. Ein über mehrere Karten verteiltes Modell wartet außerdem auf die Verbindungen zwischen ihnen, und unsere Übersicht der Benchmarks der RTX PRO 6000 sammelt veröffentlichte Messungen von Servern mit acht Karten.

Wir bauen KI-Server auf Bestellung mit vier oder acht Karten der RTX PRO 6000 Server Edition oder H200 NVL und prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schicken Sie uns das Modell, seine Präzision und Ihre Nutzerzahl über das Formular unten.

TFLOPS in einem Datenblatt oder Angebot prüfen

Vier Fragen machen zwei TFLOPS-Werte vergleichbar, und sie gelten für eine Karte, einen Server oder ein Angebot für einen Cluster.

  1. Welche Präzision: FP4, FP8, BF16 oder FP32. „AI TOPS“ bedeutet in den Datenblättern der RTX PRO Blackwell FP4 und bei der RTX 6000 Ada FP8.
  2. Sparsity oder dicht: Halbieren Sie einen Wert mit dem Vermerk „mit Sparsity“, bevor Sie ihn mit einem dichten Wert vergleichen. Wo ein Tensor-Wert keine Basis hat, fragen Sie den Lieferanten, und vergleichen Sie ihn bis zur Antwort mit beiden Raten der anderen Karte.
  3. Je Karte oder je Server: Teilen Sie eine Serversumme durch die Kartenzahl, und prüfen Sie, ob die Zahl Karten in Reserve einschließt.
  4. Welcher Takt und welche Leistung: NVIDIAs Datenblätter nennen „Peak rates based on GPU Boost Clock“, und die Max-Q Workstation Edition mit 300 W ist mit 877,9 dichten FP8-TFLOPS angegeben, gegenüber 1.007,6 bei der Workstation Edition mit 600 W.

Nennt ein Angebot PFLOPS ohne Basis, schreiben Sie uns Kartenmodell und Kartenzahl, und wir antworten innerhalb eines Werktages mit Konfiguration und Angebot.

Was wir liefern

Wir liefern jede Karte der beiden Tabellen je Karte, den DGX Spark als Founders Edition und außerdem die RTX PRO 6000 Max-Q, mit Herstellergarantie, unter einem EU-Vertrag und auf einer Rechnung. Wir bauen KI-Server mit diesen Karten auf Bestellung, montiert und im Burn-in getestet, und legen sie nach dem Modell, seiner Präzision und der Zahl der Nutzer aus. NVIDIA-AI-Enterprise- und vGPU-Lizenzen kommen auf dieselbe Rechnung. Unsere Übersicht professioneller GPUs nennt Speicher, Bandbreite und Leistungsaufnahme je Karte.

FAQ

Wie viele BF16-TFLOPS hat die H200 NVL?
NVIDIA führt die H200 NVL mit 1.671 BF16-TFLOPS der Tensor-Kerne, gekennzeichnet mit „With sparsity“, halbiert also 835,5 TFLOPS dicht. Ihr FP8-Wert beträgt 3.341 TFLOPS mit Sparsity, ihre FP32-Rate 60 TFLOPS und ihre FP64-Rate 30 TFLOPS, auf den Tensor-Kernen 60.
Wie viele TFLOPS hat die RTX PRO 6000?
NVIDIAs Seite zur Server Edition nennt 120 TFLOPS FP32, 4 PFLOPS FP4, 2 PFLOPS FP8 und 1 PFLOP BF16, ohne anzugeben, ob die Tensor-Werte mit Sparsity gelten; sie entsprechen gerundet den Sparsity-Werten der Workstation Edition. Das Architektur-Whitepaper gibt der Workstation Edition 126,0 TFLOPS FP32, im Datenblatt 125, und dicht 503,8 TFLOPS in BF16, 1.007,6 in FP8 und 2.015,2 in FP4, mit Sparsity das Doppelte.
Wie viele BF16-FLOPS hat DGX Spark?
NVIDIA veröffentlicht für DGX Spark keinen BF16-Wert. Sein einziger Rechenwert ist bis zu 1 PFLOP FP4 mit Sparsity, halbiert etwa 500 TFLOPS dicht, von einem GB10-Chip mit 6.144 CUDA-Kernen und der Compute Capability 12.1. Die Geschwindigkeit der Token-Generierung folgt eher seiner Speicherbandbreite von 273 GB/s als seinen FLOPS.
Dense vs. sparse TFLOPS: was ist der Unterschied?
Sparsity-Werte setzen Gewichte voraus, die so beschnitten sind, dass zwei von je vier Werten null sind; NVIDIAs Sparse Tensor Cores verarbeiten sie in der halben Zeit. Gewöhnliche Modell-Checkpoints sind dicht, zu vergleichen ist also der dichte Wert, die Hälfte des Sparsity-Werts. Die L40S etwa ist mit 733 dichten und 1.466 FP8-TFLOPS mit Sparsity angegeben.
Was bedeuten 4 PFLOPS FP8 bei einem GPU-Server?
Es ist der FP8-Wert je Karte mal die Zahl der Karten, und NVIDIAs H200-Seite zeigt 4 PFLOPS FP8 für eine H200 SXM, einen Wert mit Sparsity. Zwei Karten der RTX PRO 6000 Server Edition mit je 2 PFLOPS erreichen nach NVIDIAs Angaben 4 PFLOPS, ein Wert ohne angegebene Basis. Acht H200 NVL kommen auf 26,7 PFLOPS FP8 mit Sparsity oder 13,4 dicht.
Welche Compute Capability hat die H200?
NVIDIAs CUDA-GPU-Liste gibt der H200 die Compute Capability 9.0, ohne eigenen Eintrag für die NVL-Version. Die RTX-PRO-Blackwell-Karten haben 12.0, der GB10-Chip des DGX Spark 12.1 und die RTX 6000 Ada, L40S und L4 8.9. NVIDIA nennt FP4-Raten nur für die Blackwell-Karten, unter den Karten hier braucht FP4-Arithmetik auf den Tensor-Kernen also 12.0 oder 12.1.

Schicken Sie uns das Modell, seine Präzision, welcher Anteil der Last auf lange Prompts oder Training entfällt, die Zahl der Nutzer und die Stromversorgung des Rackplatzes. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien