BLOG · VERGLEICH ·

GPU für CFD-Simulation: H200 NVL oder RTX PRO 6000 für Solver in doppelter und einfacher Genauigkeit

Eurokommerz, Wien, seit 2006: Private AI/ML · IT Managed Services · Enterprise Training · KI-Hardware & Software

IN KÜRZE
  • Die Präzision des Solvers entscheidet über die Karte; NVIDIA gibt die H200 NVL mit 30 TFLOPS in FP64 an, während die RTX PRO 6000 FP64 mit 1/64 ihrer FP32-Rate rechnet, nach unserer Rechnung etwa 1,9 TFLOPS bei der Server Edition
  • Für Solver in einfacher und gemischter Genauigkeit bietet die RTX PRO 6000 Server Edition 120 TFLOPS in FP32 und 96 GB je Karte; die H200 NVL bietet 60 TFLOPS in FP32, 141 GB und 4,8 TB/s Speicherbandbreite
  • Der Hardware-Kaufleitfaden von Ansys zum Fluent GPU Solver plant 1,2 GB je Million Hexaederzellen in einfacher Genauigkeit mit dem segregierten Solver und 3,6 GB in doppelter Genauigkeit mit dem gekoppelten Solver, eine Karte mit 96 GB fasst also etwa 80 oder 26 Millionen Zellen
  • STAR-CCM+ 2602 rechnet VOF und Mixture Multiphase auf seinem GPU-nativen Solver; das Paper von HP vom Januar 2025 nutzte die Mixed-Precision-Version von Release 2310, und Siemens schrieb 2024, dass eine Lizenz Power Session Plus unbegrenzt viele CPUs oder GPUs abdeckt
  • Fluent zählt GPU-Lizenzen nach Streaming-Multiprozessoren, wobei 40 SMs in CFD Enterprise enthalten sind, und Ansys verlangt mindestens so viel System-RAM wie GPU-Speicher insgesamt

Geliefert von Eurokommerz: KI-Server, auf Bestellung gebaut  Konfiguration anfragen →

Welche GPU für CFD: H200 NVL oder RTX PRO 6000

Wählen Sie eine GPU für CFD nach der Präzision, in der Ihr Solver rechnet. Ein Fall, der in doppelter Genauigkeit laufen muss, gehört auf die H200 NVL, die NVIDIA mit 30 TFLOPS in FP64 angibt. Die RTX PRO 6000 rechnet FP64 mit 1/64 ihrer FP32-Rate, nach unserer Rechnung etwa 1,9 TFLOPS bei der Server Edition. Sie eignet sich für Solver, die in einfacher oder gemischter Genauigkeit rechnen, wo ihre 120 TFLOPS in FP32 und 96 GB je Karte zählen. Nach der Präzision bestimmt der Kartenspeicher die Netzgröße je GPU, und die Speicherbandbreite bestimmt einen großen Teil der Geschwindigkeit.

GPUFP64FP32SPEICHERBANDBREITE
NVIDIA H200 NVL30 TFLOPS, 60 auf Tensor-Kernen60 TFLOPS141 GB HBM3e4,8 TB/s
RTX PRO 6000 Server Editionetwa 1,9 TFLOPS120 TFLOPS96 GB GDDR7, ECC1.597 GB/s
RTX PRO 6000 Workstationetwa 2,0 TFLOPS125 TFLOPS96 GB GDDR7, ECC1.792 GB/s

Produktseiten von NVIDIA zur H200, zur RTX PRO 6000 Server Edition und zur RTX PRO 6000 Workstation Edition, gelesen am 10. Oktober 2026; die FP64-Rate von 1/64 aus NVIDIAs Whitepaper zur Architektur von RTX Blackwell PRO, v1.1. Die FP64-Werte der RTX PRO 6000 sind unsere Rechnung, da NVIDIAs Produktseiten keine nennen.

Beide sind PCIe-Gen5-Karten mit bis zu 600 W, dieselbe Serverklasse nimmt also jede der beiden auf. Die H200 NVL verbindet außerdem 2 oder 4 Karten über eine NVLink-Brücke mit 900 GB/s je GPU, und die RTX PRO 6000 hat kein NVLink. Unser Vergleich der beiden als Ersatz für die A100 behandelt die Unterschiede bei Stromkabel, Treiber und MIG, die für einen Simulationsserver ebenso gelten.

Doppelte Genauigkeit auf der RTX PRO 6000 und der H200 NVL

NVIDIAs Whitepaper zur Architektur von RTX Blackwell PRO (Version 1.1) sagt, dass der Chip GB202 zwei FP64-Kerne je SM hat und dass „die FP64-TFLOP-Rate 1/64 der TFLOP-Rate von FP32-Operationen beträgt“. NVIDIA nennt auch den Grund: Die wenigen FP64-Kerne seien enthalten, „um sicherzustellen, dass alle Programme mit FP64-Code korrekt arbeiten“. Ein Code in doppelter Genauigkeit läuft auf der RTX PRO 6000 also, aber auf der Server Edition mit etwa 1,9 TFLOPS. Die H200 NVL ist eine Hopper-Karte mit nativen FP64-Kernen, angegeben mit 30 TFLOPS und mit 60 TFLOPS auf ihren Tensor-Kernen.

Ob ein Fall doppelte Genauigkeit braucht, ist eine Frage des Solvers und der Validierung, die das Simulationsteam beantwortet. Der Hardware-Kaufleitfaden von Ansys zum Fluent GPU Solver, zuletzt geändert am 9. April 2026, nennt sie „die wichtigste Frage, die zu bedenken ist“. Wo doppelte Genauigkeit nötig ist, findet der Leitfaden die High-End-Serverprodukte „attraktiver“. In einfacher Genauigkeit nutzt der Fluent GPU Solver laut Leitfaden „primär die FP32-Kerne der GPU“ und verwendet die FP64-Kerne nicht, selbst wo eine Karte sie hat. Derselbe Leitfaden berichtet, dass der Fluent GPU Solver im Allgemeinen „in einfacher Genauigkeit besser konvergiert als der Fluent CPU Solver“.

Fluent kann seinen Modus mit doppelter Genauigkeit auch auf Karten ohne native FP64-Kerne ausführen. Der Leitfaden sagt, dass auf solchen Karten „doppelte Genauigkeit mit etwa der halben Geschwindigkeit läuft“ und: „Wenn native FP64-Kerne vorhanden sind, wie bei der H100, ist diese Emulation unnötig“. Die H200 NVL nutzt dieselbe Hopper-Architektur. Der Leitfaden zählt Karten „bis hin zur NVIDIA RTX 6000 Ada“ zu denen ohne FP64-Kerne, sagt aber nicht, welchen Weg Fluent auf der RTX PRO 6000 mit ihren zwei FP64-Kernen je SM nimmt. Ein Blogbeitrag von Ansys vom 22. Juli 2026 ergänzt einen dritten Modus, gpu_hybrid_precision, der laut Ansys „nahezu die Genauigkeit doppelter Präzision bei geringerem RAM-Bedarf und kürzerer Rechenzeit liefern kann“. Für ein Team, das Fluent heute in doppelter Genauigkeit betreibt, ist dieser Modus das Erste, was es vor der Wahl der RTX PRO 6000 validieren sollte.

Fluent GPU Solver: Speicher je Million Zellen

Der Fluent GPU Solver braucht den gesamten Fall im GPU-Speicher, und Ansys veröffentlicht, mit wie viel Speicher je Million Zellen es plant. Der Kaufleitfaden setzt „1,2 GB GPU-RAM je Million Zellen für ein typisches stationäres SIMPLE-Modell in einfacher Genauigkeit“ an und stellt fest, dass der tatsächliche Bedarf vom Fall abhängt. Das Fluent-Benutzerhandbuch für Release 2024 R2 nennt etwa 1 GB je Million Hexaederzellen in einfacher Genauigkeit mit Turbulenz, 50 Prozent mehr GPU-Speicher für doppelte Genauigkeit und 20 bis 40 Prozent mehr für ein Polyedernetz.

FLUENT-FALLGB JE MIO. ZELLENZELLEN AUF 96 GBZELLEN AUF 141 GB
Hex, einfach, segregiert1,2etwa 80 Millionenetwa 117 Millionen
Hex, einfach, gekoppelt2,2etwa 43 Millionenetwa 64 Millionen
Hex, doppelt, segregiert1,9etwa 50 Millionenetwa 74 Millionen
Hex, doppelt, gekoppelt3,6etwa 26 Millionenetwa 39 Millionen
Poly, einfach, segregiert1,8etwa 53 Millionenetwa 78 Millionen
Poly, doppelt, gekoppelt5,6etwa 17 Millionenetwa 25 Millionen

GB je Million Zellen aus dem Hardware-Kaufleitfaden von Ansys zum Fluent GPU Solver (Ansys Innovation Space, zuletzt geändert am 9. April 2026). Die Zellenzahlen sind unsere Division des nominellen Kartenspeichers, abgerundet, und Obergrenzen vor dem Prozess-Overhead.

Jeder Fluent-Rechenprozess belegt laut Leitfaden außerdem etwa 95 MB GPU-Speicher und 210 MB Systemspeicher. Mehrere GPUs, in einem Server oder über mehrere Server verteilt, legen ihren Speicher für einen Fall zusammen: „Die Summe des Speichers aller GPU-Karten muss das Modell und den Rechen-Overhead aufnehmen können.“ Der Leitfaden warnt außerdem, dass die Leistung mit mehreren GPUs durch die langsamste Karte und den kleinsten Speicher im Verbund begrenzt wird, und empfiehlt gleiche Karten. Ein Hexaederfall mit 60 Millionen Zellen in doppelter Genauigkeit mit dem gekoppelten Solver braucht daher etwa 216 GB auf gleichen Karten, nach unserer Rechnung drei RTX PRO 6000 oder zwei H200 NVL, und dazu kommt noch Reserve.

Wir bauen GPU-Server mit Karten RTX PRO 6000 Server Edition oder H200 NVL rund um die Fallgröße und die Präzision, mit der Sie rechnen. Schicken Sie uns Ihren größten Fall mit Zellenzahl, Netztyp und Präzision, und Konfiguration und Angebot folgen innerhalb eines Werktages.

Fluent-Lizenzen und die Zahl der SMs

Ansys lizenziert den Fluent GPU Solver nach Streaming-Multiprozessoren, nicht nach Karten. Der Kaufleitfaden stellt fest, dass „40 SMs/CUs in der Lizenz CFD Enterprise enthalten sind“, dass zusätzliche SMs Ansys-HPC-Lizenzen brauchen und dass eine Lizenz CFD HPC Ultimate Zugang zu unbegrenzt vielen SMs gibt. NVIDIAs Whitepaper nennt 188 SMs für die RTX PRO 6000 Workstation Edition, und die Tabelle des Leitfadens nennt 188 für die RTX PRO 6000 Blackwell. NVIDIAs Produktseite zur H200 nennt keine SM-Zahl für die H200 NVL; fragen Sie daher Ihren Ansys-Vertriebspartner nach der Lizenzzahl je Karte, bevor Sie Konfigurationen vergleichen.

GPU-nativer Solver in Siemens STAR-CCM+

Siemens beschreibt einen GPU-nativen Solver für STAR-CCM+. Sein Blogbeitrag vom 18. Februar 2022 stellt fest, „NVIDIA-GPUs mit Volta-Architektur oder neuer werden unterstützt“, und Karten mit HBM2 werden „gegenüber Graphics Double Data Rate 6 (GDDR6) bevorzugt“. Damals deckte der GPU-Solver Strömungen mit konstanter Dichte mit dem segregierten Solver ab, und ein Beitrag von Siemens vom 21. Juni 2023 kündigte den gekoppelten Solver auf der GPU an. Der Release-Beitrag von Siemens zur Version 2602 vom 24. Februar 2026 ergänzt GPU-native Solver für Volume of Fluid und Mixture Multiphase, eine bessere Skalierung über mehrere GPUs und eine breitere Unterstützung von AMD-GPUs. Er stellt außerdem fest, dass „für CPU- und GPU-Läufe derselbe Solver verwendet wird“. Volupe, ein Solutions Partner von Siemens, schrieb am 27. Februar 2026, dass 2602 „offiziell die Nvidia-Blackwell-GPU-Serie unterstützt“, die Generation der RTX PRO 6000.

Die Beiträge von Siemens, die wir gelesen haben, nennen nicht, in welcher Gleitkommapräzision der GPU-native Solver rechnet. Das technische Paper von HP vom Januar 2025 betrieb die „Mixed-Precision-Version“ von STAR-CCM+ 2310 auf bis zu vier Karten RTX 6000 Ada mit je 48 GB. In diesem Test brauchte ein Fall mit 57 Millionen Zellen mindestens zwei Karten und ein Fall mit 106 Millionen Zellen mindestens drei. Klären Sie mit Siemens oder Ihrem Händler, ob Ihre physikalischen Modelle auf der GPU in der Präzision laufen, mit der Sie validieren.

Zur Lizenzierung schrieb Siemens am 20. Juni 2024, dass „eine einzige Power-Session-Plus-Lizenz es Ihnen ermöglicht, auf unbegrenzt vielen CPUs oder GPUs zu rechnen“, ohne Unterschied nach GPU-Typ. Volupe gibt an, dass die GPU-Nutzung eine Lizenz Power Session Plus oder Power-on-Demand voraussetzt.

OpenFOAM und eigene Codes

Das OpenFOAM High Performance Computing Technical Committee führt auf seiner Seite, zuletzt bearbeitet am 26. November 2025, „GPU enabling of OpenFOAM“ als aktuelle Priorität. Es nennt GPU-Unterstützung für die Bibliothek PETSc4FOAM als geplante Aktivität und führt die Entwicklung des GPU-Solvers AmgX unter seinen Aufgaben. Wir haben kein OpenFOAM-Dokument gefunden, das dafür eine GPU-Klasse nennt; die Karte ergibt sich also aus der GPU-Bibliothek, die Sie nutzen, und der Präzision, in der sie rechnet. Fragen Sie bei eigenen Codes oder Forschungscodes die Entwickler, ob die Kernel FP64 nutzen, denn das allein trennt die beiden Karten um einen Faktor von etwa 16.

SOLVERGPU-UNTERSTÜTZUNGPRÄZISION AUF GPUPASSENDE KARTE
Ansys Fluent GPU SolverNVIDIA, und AMD unter Linux ab 2025 R1; der Leitfaden nennt A100, H100, L40 und RTX A6000einfach, doppelt, hybridRTX PRO 6000 für einfach oder hybrid; H200 NVL für doppelt mit voller Rate
Siemens STAR-CCM+NVIDIA Volta oder neuer, Blackwell ab 2602; AMDgemischt im Test von HP; von Siemens nicht genanntRTX PRO 6000 für gemischt; H200 NVL für HBM-Bandbreite
OpenFOAMGPU-Unter­stützung vom HPC-Komitee als Priorität geführtnicht genanntfolgt der GPU-Bibliothek und ihrer Präzision

Fluent-GPU-Kaufleitfaden von Ansys (9. April 2026) und Ansys-Blog (22. Juli 2026); Blogbeiträge von Siemens (2022, 2024, Februar 2026), Volupe (Februar 2026), HP-Paper C09079055 (Januar 2025); Seite des OpenFOAM HPC Technical Committee. Die passende Karte ist unsere Lesart dieser Quellen.

Speicherbandbreite und Skalierung über mehrere GPUs

Der Leitfaden von Ansys stellt fest, dass die Speicherbandbreite „wichtig ist, um die Daten zu den SMs/CUs zu transportieren“, und: „In den meisten Fällen profitieren Sie von einer höheren Speicherbandbreite.“ Die H200 NVL liest ihren Speicher mit 4,8 TB/s, dem Dreifachen der 1.597 GB/s der RTX PRO 6000 Server Edition. In einfacher Genauigkeit hat die RTX PRO 6000 die doppelte FP32-Rate; welche Karte einen Fall in einfacher Genauigkeit zuerst abschließt, hängt also vom Solver ab, und wir haben kein veröffentlichtes Ergebnis von Fluent oder STAR-CCM+ gefunden, das die beiden Karten einander gegenüberstellt.

Der Blogbeitrag von Ansys vom 22. Juli 2026 hat Fluent 2026 R1 auf vier Karten RTX PRO 6000 Blackwell Server gegen CPU-Referenzen gemessen. Beim Fall DrivAer mit 50 Millionen Zellen lieferten die vier Karten „etwa eine ~4,6-fache Beschleunigung“ gegenüber einer Referenz von etwa 516 CPU-Kernen. Ansys ordnet diese Konfigurationen kleineren Jobs und „kostensensibleren Server-Deployments“ zu, und der Beitrag hat die H200 NVL nicht getestet. NVIDIAs HPC-Angaben zur H200 NVL und die Testbedingungen, die wir dazu nicht finden konnten, behandelt unser Vergleich von H200 NVL und H100 NVL.

Wir haben keine Aussage von Ansys gefunden, dass der Fluent GPU Solver die NVLink-Brücken der H200 NVL nutzt; fragen Sie daher den Solver-Hersteller, bevor Sie Brücken für einen reinen CFD-Server einplanen.

Simulationsserver mit GPU: Konfiguration für CFD

Ansys empfiehlt „mindestens so viel System-Arbeitsspeicher (RAM) wie GPU-Speicher insgesamt“, und sein Leitfaden rechnet bei Polyedernetzen mit mehr. Vier Karten RTX PRO 6000 verlangen daher mindestens 384 GB Systemspeicher, vier Karten H200 NVL mindestens 564 GB. Mit bis zu 600 W je Karte ziehen vier Karten 2,4 kW, bevor Prozessoren und Lüfter hinzukommen, und unser Artikel dazu, wie viele GPUs in einen Server passen, erklärt die PCIe-Lanes, Stromzuführungen und den Luftstrom, die über die Zahl der Karten entscheiden.

Auch eine gemischte Nutzung spricht für eine bestimmte Karte. NVIDIA stellt die RTX PRO 6000 Server Edition für „Datenanalyse, technische Simulation und Visual Computing“ vor, derselbe Server kann also auch Ergebnisse rendern. Wenn er außerdem Sprachmodelle betreibt, behandelt unser Inferenzvergleich von RTX PRO 6000 und H200 NVL diese Seite.

Wir prüfen Rack, Strom und Luftstrom, bevor wir ein Angebot erstellen. Schreiben Sie uns den Solver, seine Version, Ihren größten Fall und die Stromversorgung der Rackposition, und wir antworten innerhalb eines Werktages.

Was wir liefern

Wir liefern die H200 NVL und die RTX PRO 6000 in der Server, Workstation und Max-Q Edition als professionelle NVIDIA-GPUs und bauen GPU-Server auf Bestellung rund um sie, montiert und im Burn-in getestet, mit Herstellergarantie auf jede Komponente. Ein Server für einen Solver in doppelter Genauigkeit bekommt Karten H200 NVL, mit NVLink-Brücken, wo die Arbeitslast sie nutzt, und ein Server für einfache oder gemischte Genauigkeit bekommt Karten RTX PRO 6000 Server Edition. Wir bauen auch auf Ihrem eigenen Gehäuse oder mit Teilen, die Sie bereits haben, nach einer Kompatibilitätsprüfung von Plattform, Strom und Kühlung. Betriebssystem, Treiber und CUDA installieren wir auf Wunsch, und alles kommt unter einem EU-Vertrag und auf einer Rechnung, mit Lieferung in die ganze EU.

FAQ

Welche GPU ist für CFD besser, die H200 NVL oder die RTX PRO 6000?
Das hängt von der Präzision ab, in der Ihr Solver rechnet. Für Arbeit in doppelter Genauigkeit ist die H200 NVL mit 30 TFLOPS in FP64 die Karte der Wahl, während die RTX PRO 6000 FP64 mit 1/64 ihrer FP32-Rate rechnet, etwa 1,9 TFLOPS bei der Server Edition. Für Solver in einfacher oder gemischter Genauigkeit bietet die RTX PRO 6000 120 TFLOPS in FP32 und 96 GB je Karte.
Braucht der Fluent GPU Solver FP64?
Nicht in einfacher Genauigkeit, in der er laut Ansys primär die FP32-Kerne der GPU nutzt und FP64-Kerne nicht verwendet, selbst wo eine Karte sie hat. Fluent kann auch auf Karten ohne native FP64-Kerne in doppelter Genauigkeit rechnen, laut dem Kaufleitfaden von Ansys mit etwa halber Geschwindigkeit, wobei der Leitfaden nicht sagt, welchen Weg Fluent auf der RTX PRO 6000 nimmt. Der hybride Präzisionsmodus von Ansys, der laut Ansys nahezu die Genauigkeit doppelter Präzision mit weniger Speicher liefert, ist eine dritte Option.
Wie viel GPU-Speicher braucht Fluent je Million Zellen?
Der Kaufleitfaden von Ansys plant etwa 1,2 GB je Million Hexaederzellen in einfacher Genauigkeit mit dem segregierten Solver und 3,6 GB in doppelter Genauigkeit mit dem gekoppelten Solver. Polyedernetze brauchen mehr, bis zu 5,6 GB je Million Zellen in doppelter Genauigkeit mit dem gekoppelten Solver. Eine RTX PRO 6000 mit 96 GB fasst daher etwa 80 oder 26 Millionen Hexaederzellen, vor dem Prozess-Overhead.
Unterstützt STAR-CCM+ GPUs?
Ja, STAR-CCM+ hat einen GPU-nativen Solver für NVIDIA-GPUs ab der Volta-Architektur und für AMD-GPUs, und Version 2602 hat Volume of Fluid und Mixture Multiphase auf der GPU ergänzt. Das Paper von HP vom Januar 2025 nutzte die Mixed-Precision-Version von Release 2310 auf Karten RTX 6000 Ada. Siemens schrieb im Juni 2024, dass eine Lizenz Power Session Plus unbegrenzt viele CPUs oder GPUs abdeckt.
Eignet sich die RTX PRO 6000 für FP64-Simulation in doppelter Genauigkeit?
Nicht für Codes, die überwiegend in FP64 rechnen. NVIDIAs Whitepaper sagt, dass ihre zwei FP64-Kerne je SM dafür da sind, dass FP64-Programme korrekt laufen, mit 1/64 der FP32-Rate. Codes in doppelter Genauigkeit gehören auf die H200 NVL, die NVIDIA mit 30 TFLOPS in FP64 angibt.
Wie viel Arbeitsspeicher braucht ein GPU-Server für CFD?
Ansys empfiehlt mindestens so viel Systemspeicher wie GPU-Speicher insgesamt im Server und mehr für Polyedernetze. Ein Server mit vier Karten RTX PRO 6000 braucht daher mindestens 384 GB, einer mit vier Karten H200 NVL mindestens 564 GB. Jeder Fluent-Rechenprozess belegt außerdem etwa 210 MB Systemspeicher.

Schicken Sie uns den Solver und seine Version, die Präzision, in der Sie rechnen, die Zellenzahl und den Netztyp Ihres größten Falls sowie die Stromversorgung der Rackposition. Wir antworten innerhalb eines Werktages mit einer Konfiguration und einem schriftlichen Angebot und prüfen Rack, Strom und Luftstrom, bevor wir das Angebot erstellen.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten; siehe unsere Datenschutzerklärung.

request@eurokommerz.at
Jordangasse 7, 1010 Wien