BLOG · HARDWARE-REVIEW ·

NVIDIA H200 NVL: was MLPerf® Inference und Training gemessen haben, was das je Karte und je Nutzer bedeutet, und die Grenzen, die das Datenblatt auslässt

IN KÜRZE
  • In MLPerf Inference v6.0, Closed Division, erreichte Dells PowerEdge XE7740 mit acht H200 NVL bei 600 W (Ergebnis 6.0-0021) mit Llama 2 70B in FP8 offline 32.004 Token pro Sekunde, im Server-Szenario 29.085 und im Interactive-Szenario 16.344: etwa 4.000, 3.640 und 2.040 je Karte, das Systemergebnis von uns geteilt, keine MLPerf-Metrik
  • Die Latenzgrenzen entscheiden, was ein Nutzer sieht: Nach unserer Rechnung aus den Logs der Läufe, keine MLPerf-Metriken, bekam jede Anfrage im Server-Lauf etwa 6,5 Token pro Sekunde und im Interactive-Lauf 28, gegenüber einer Obergrenze von etwa 68 für eine einzelne Anfrage auf einer Karte bei einem 70B-Modell in FP8
  • Im selben Dell-Gehäuse, in derselben Runde und Division (Ergebnisse 6.0-0021 und 6.0-0022) lagen acht H200 NVL mit FP8-Gewichten offline 18 Prozent und im Server-Szenario 14 Prozent vor acht RTX PRO 6000 Server Edition mit FP4-Gewichten; gegenüber Ergebnis 6.0-0004, einem anderen System mit acht RTX PRO 6000 und FP4-Gewichten, lieferten sie je Karte etwa das 2,6-Fache des Durchsatzes im Interactive-Szenario, nach unserer Rechnung
  • MLPerf Training v6.0, Closed Division, listet zwei Dell-Server mit acht H200 NVL (Ergebnisse 6.0-0046 und 6.0-0047): 31,25 und 42,11 Minuten für das Fine-Tuning von Llama 2 70B mit LoRA bis zum Zielwert, 257,4 und 292,8 Minuten für das Vortraining von Llama 3.1 8B bis zu dessen Zielwert
  • Die Grenzen: keine FP4-Arithmetik, NVLink-Brücken, die zwei oder vier Karten verbinden, ein 16-poliges Kabel, das 451 bis 600 W melden muss, sonst startet die Karte nicht, und vGPU nur für Compute; für NVIDIAs Angabe von bis zum 1,7-Fachen der H100 NVL bei LLM-Inferenz haben wir keine Testbedingungen gefunden

Die Karte und woher die Zahlen kommen

Die H200 NVL ist NVIDIAs Hopper-GPU auf einer passiv gekühlten PCIe-Karte in Dual-Slot-Bauform und voller Länge: 141 GB HBM3e mit 4,8 TB/s, eine bis zu 600 W konfigurierbare Leistungsaufnahme, 3.341 TFLOPS in FP8 laut NVIDIAs Tabelle, die Sparsity mitzählt (1.670,5 dicht), und ein Anschluss für eine Zweifach- oder Vierfach-NVLink-Brücke mit 900 GB/s je GPU. Dieses Review trägt veröffentlichte Messungen zusammen; wir haben die Karte nicht selbst getestet.

Die ergiebigste Quelle sind die Benchmark-Ergebnisse von MLPerf® Inference und Training: MLCommons veröffentlicht jedes Ergebnis mit seiner Systembeschreibung und den Logs seiner Läufe. Server von Dell, Cisco und anderen mit acht H200 NVL erscheinen in MLPerf Inference v5.0 (April 2025), v5.1 (September 2025) und v6.0 (1. April 2026), zwei Dell-Server außerdem in MLPerf Training v6.0 (Juni 2026). NVIDIAs Performance-Übersicht zu TensorRT-LLM vom 21. September 2026 führt die H200 SXM, aber nicht die NVL-Karte, und NVIDIAs Seite zur Inferenzleistung enthält keine Ergebnisse der H200 NVL. Unabhängige Messungen sind rar: In einem am 23. September 2026 veröffentlichten Test hat StorageReview eine H200 NVL in einem Dell PowerEdge R770 als Vergleichssystem für kleinere Modelle einbezogen und mit vLLM die Ausgabe-Token pro Sekunde gemessen, bei 512 Eingabe- und 512 Ausgabe-Token sowie bei 8.192 und 1.024, mit einem bis 128 gleichzeitigen Streams. MLPerf Inference v6.1 wurde am 16. September 2026 veröffentlicht; dieses Review zitiert Ergebnisse bis v6.0.

Llama 2 70B in MLPerf Inference

Der Benchmark Llama 2 70B von MLPerf Inference beantwortet Fragen aus dem Datensatz OpenOrca, nach unserer Rechnung aus den Logs etwa 290 generierte Token je Antwort, in drei Szenarien. Das Szenario Offline übergibt dem System alle Samples auf einmal und misst den Durchsatz ohne Latenzgrenze. Das Szenario Server schickt Anfragen in zufälligen Abständen und meldet den Durchsatz, den das System hält, solange das 99. Perzentil der Zeit bis zum ersten Token (TTFT) innerhalb von 2 s bleibt und das der Zeit pro Ausgabe-Token (TPOT), also des mittleren Abstands zwischen generierten Token, innerhalb von 200 ms. Das Szenario Interactive verschärft die Grenzen auf 450 ms und 40 ms. Das Ergebnis aus v6.0 stammt von Dells PowerEdge XE7740: acht Karten bei 600 W Leistungsaufnahme, zwei Prozessoren vom Typ Xeon 6747P und FP8-Gewichte.

SZENARIOLATENZGRENZEN8 KARTEN, TOK/SJE KARTEMITTLERE TPOT
Offlinekeine32.004,04.000nicht gemeldet
ServerTTFT 2 s, TPOT 200 ms29.084,93.636154 ms
InteractiveTTFT 450 ms, TPOT 40 ms16.343,82.04335 ms

MLPerf Inference v6.0, Datacenter, Closed Division, verfügbare Systeme: Llama 2 70B (99 Prozent der Referenzgenauigkeit), Szenarien Offline, Server und Interactive, Ergebnis 6.0-0021, Dell PowerEdge XE7740 mit acht H200 NVL; die Latenzgrenzen gelten für das 99. Perzentil. Jedes MLPerf-Ergebnis auf dieser Seite: abgerufen von mlcommons.org am 24. September 2026, Ergebnis von der MLCommons Association verifiziert. Software laut Dell: TensorRT in Version 10.13 und Version 10.14, CUDA 13.0, Treiber 580.126.09. Die Werte je Karte sind das Systemergebnis, von uns durch die Zahl seiner GPUs geteilt, keine MLPerf-Metrik; die mittlere TPOT stammt aus den Logs der Läufe. The MLPerf name and logo are registered and unregistered trademarks of MLCommons Association in the United States and other countries. All rights reserved. Unauthorized use strictly prohibited. See www.mlcommons.org for more information.

Die frühere Runde stimmt damit überein. In MLPerf Inference v5.0, Closed Division, erreichte Dells PowerEdge XE7745 mit acht Karten (Ergebnis 5.0-0017) mit Llama 2 70B offline 31.149,9 Token pro Sekunde und 16.134,4 unter den Interactive-Latenzgrenzen, die v5.0 als eigenen Benchmark, Llama 2 70B Interactive, im Server-Szenario laufen ließ: innerhalb von 3 Prozent der Werte aus v6.0, über zwei Runden, zwei Gehäuse und TensorRT von Version 10.8 bis Version 10.14 hinweg; die von uns gelesenen Dateien aus v5.0 nennen keine Präzision der Gewichte. Das sind stabile Referenzwerte für die Karte mit NVIDIAs TensorRT-Stack, den jedes von uns gelesene Ergebnis der H200 NVL verwendet hat; Ergebnisse mit einer anderen Engine können abweichen. Die Systembeschreibungen nennen NVLink als Verbindung zwischen den Karten, aber keine gibt an, wie die Brücken gesteckt waren.

Was eine einzelne Anfrage bekommt

Nach unserer Rechnung aus der mittleren TPOT in den Logs der Läufe, keine MLPerf-Metriken, bekam jede Anfrage im Server-Lauf etwa 6,5 Token pro Sekunde und im Interactive-Lauf etwa 28; teilt man den Durchsatz je Karte durch diese Raten, waren im Mittel rund 560 und 72 Anfragen je Karte gleichzeitig in Bearbeitung. Die Server-Zeile steht für einen Dienst mit sehr großen Batches, in dem jede Antwort etwa im Lesetempo gestreamt wird; die Interactive-Zeile gibt jeder Anfrage mehr als das Vierfache dieses Tempos, für 56 Prozent des Durchsatzes.

Auf einer Karte setzt die Speicherbandbreite die Obergrenze für eine einzelne Anfrage, denn jedes generierte Token liest alle Gewichte einmal: Für ein dichtes 70B-Modell in FP8, etwa 70 GB, erlauben 4,8 TB/s etwa 68 Token pro Sekunde, eine Obergrenze und keine Messung. Der Interactive-Lauf gab jeder seiner 72 Anfragen je Karte etwa 40 Prozent davon. Sind viele Anfragen gleichzeitig in Bearbeitung, werden die Gewichte je Schritt einmal für alle gelesen, und die Arbeit verlagert sich zur Arithmetik: NVIDIA schrieb im März 2024, Llama 2 70B auf der H200 (SXM) sei nach seinen Optimierungen in TensorRT-LLM „durch die Rechenleistung begrenzt statt durch Speicherbandbreite oder Kommunikationsengpässe“. Die H200 NVL hat dieselben Spitzenwerte bei der Rechenleistung wie die H100 NVL, ihre Zugewinne gegenüber dieser Karte kommen also vor allem vom Speicher; die ältere Karte kann durch ihre niedrigere Leistungsgrenze, 350 bis 400 W gegenüber bis zu 600 W, unter Dauerlast außerdem Takt verlieren, wie unser Vergleich der beiden darlegt.

Zur Kapazität: Der Treiber meldet 143.771 MiB, also 140,4 GiB, den Wert, den Dell auch in seine Systembeschreibungen für MLPerf Training einträgt. Nach der Dimensionierungsregel unseres Leitfadens zu gleichzeitigen Nutzern bleiben von 90 Prozent davon, abzüglich 3 GiB Overhead und 67,7 GiB Gewichten von Llama 3.3 70B in FP8, 55,7 GiB für den Cache auf einer Karte: 44 Sitzungen zu 8.192 Token mit einem FP8-Cache von je 1,25 GiB.

Gegen die RTX PRO 6000 im selben Server

Für v6.0 hat Dell den XE7740 auch mit acht RTX PRO 6000 Blackwell Server Edition laufen lassen, ebenfalls bei 600 W mit TensorRT auf CUDA 13.0, aber mit FP4-Gewichten, einem Format, in dem Hopper nicht rechnen kann.

SZENARIO8 × H200 NVL8 × RTX PRO 6000VORSPRUNG H200 NVL
Offline32.004,027.034,818 %
Server29.084,925.524,114 %

MLPerf Inference v6.0, Datacenter, Closed Division, verfügbare Systeme, Llama 2 70B (99 Prozent der Referenzgenauigkeit), Szenarien Offline und Server, Token pro Sekunde für acht Karten in Systemen vom Typ Dell PowerEdge XE7740: Ergebnis 6.0-0021, H200 NVL mit FP8-Gewichten, und Ergebnis 6.0-0022, RTX PRO 6000 Server Edition mit FP4-Gewichten, über PCIe-Switches verbunden; auch Prozessoren, Hostspeicher und Treiber-Builds unterscheiden sich. Die Prozentangaben sind unsere Rechnung, keine MLPerf-Metriken.

In den beiden Durchsatzszenarien liegt die H200 NVL nur 18 und 14 Prozent vorn: Nach NVIDIAs Darstellung dieses Benchmarks stützt sich Arbeit in Batches auf die Arithmetik, und die Blackwell-Karte rechnet in FP4. Für den XE7740 mit RTX PRO 6000 gibt es keinen Eintrag im Interactive-Szenario. Ergebnis 6.0-0004, acht RTX PRO 6000 Server Edition mit FP4-Gewichten im Server eines anderen Herstellers, mit eigenen Prozessoren und eigener Software, erreichte im Interactive-Szenario derselben Runde und Division 6.238,1 Token pro Sekunde, womit die H200 NVL je Karte nach unserer Rechnung auf etwa das 2,6-Fache kommt. Dasselbe System erreichte offline 27.812,9 Token pro Sekunde und im Server-Szenario 28.038,5, gegenüber diesem System lag die H200 NVL in diesen Szenarien also 15 und 4 Prozent vorn. Bei einer Grenze von 40 ms je Token zählt das Tempo je Anfrage, und die H200 NVL liest ihren Speicher dreimal so schnell, 4,8 TB/s gegenüber 1.597 GB/s. Unser Vergleich der beiden Karten macht daraus eine Kaufregel. Entscheidend bleibt Ihre eigene Last: Das technische Assessment unseres Services KI/ML-Integration, erbracht von unserem Engineering-Partner Vixen.UNO, umfasst Modell- und GPU-Auswahl und einen Pilotplan mit Metriken.

Kleinere Modelle und Training

BENCHMARKMLPERF-RUNDESYSTEMERGEBNIS
Llama 3.1 8B, OfflineInference v6.0Dell XE774053.193,6 Tok/s
Llama 3.1 8B, ServerInference v6.0Dell XE774045.075,8 Tok/s
Llama 2 70B LoRATraining v6.0Dell XE774031,25 min
Llama 2 70B LoRATraining v6.0Dell XE774542,11 min
Llama 3.1 8B VortrainingTraining v6.0Dell XE7740257,4 min
Llama 3.1 8B VortrainingTraining v6.0Dell XE7745292,8 min

MLPerf Inference v6.0, Datacenter, Closed Division, verfügbare Systeme, Llama 3.1 8B, Szenarien Offline und Server, Ergebnis 6.0-0021 (FP8-Gewichte, TensorRT, CUDA 13.0); MLPerf Training v6.0, Closed Division, verfügbare On-Premise-Systeme, Llama 2 70B LoRA und Llama 3.1 8B, Ergebnisse 6.0-0046 (XE7740) und 6.0-0047 (XE7745), NVIDIA NGC PyTorch 26.04. Abgerufen von mlcommons.org am 24. September 2026, Ergebnisse von der MLCommons Association verifiziert. Jedes System hat acht H200 NVL bei 600 W. Die Trainingsergebnisse sind Minuten tatsächlicher Laufzeit bis zum Qualitätsziel des Benchmarks.

Bei Llama 3.1 8B, das viele Male in den Speicher einer Karte passt, sind das offline etwa 6.650 Token pro Sekunde je Karte und 5.630 unter den Grenzen des Server-Szenarios von 2 s bis zum ersten Token und 100 ms je Token im 99. Perzentil, das Systemergebnis von uns geteilt, keine MLPerf-Metrik.

MLPerf Training v6.0 listet zwei Dell-Server mit acht H200 NVL. Der LoRA-Benchmark führt ein Fine-Tuning von Llama 2 70B auf SCROLLS GovReport durch, bis der Kreuzentropie-Verlust auf 0,925 fällt; der Benchmark mit Llama 3.1 8B ist ein Vortraining auf C4 bis zu einer Log-Perplexität von 3,3. Dell beschreibt seine Läufe als BF16 Mixed Precision mit FP8-Beschleunigung durch NVIDIAs Transformer Engine. Mit demselben Kartenmodell und derselben Software, aber anderen Prozessoren und anderem Hostspeicher brauchte der XE7745 (AMD EPYC 9655, 1,5 TB) für LoRA 35 Prozent länger als der XE7740 (Intel Xeon 6767P, 3,072 TB) und für das Vortraining 14 Prozent länger; die Ergebnisse sagen nicht, warum, aber eine veröffentlichte Zahl gehört eindeutig zu einem ganzen System und nicht zur Karte allein. Unser Fine-Tuning-Vergleich vergleicht die H200 NVL mit der RTX PRO 6000 nach Speicher, Tensor-Raten und der Verbindung zwischen den Karten.

Was NVIDIA angibt

NVIDIAs Angaben zu dieser Karte sind Verhältniszahlen. Die Produktseite sagt, mit bis zu vier Karten über NVLink und dem 1,5-Fachen an Speicher laufe LLM-Inferenz bis zu 1,7-mal und liefen HPC-Anwendungen bis zu 1,3-mal schneller als auf der H100 NVL; NVIDIAs Blogbeitrag zum Marktstart vom 18. November 2024 wiederholt beides und nennt für HPC zusätzlich das 2,5-Fache gegenüber der Ampere-Generation. Keine der beiden Quellen nennt Testbedingungen. Die Benchmark-Diagramme auf der Produktseite sind Messungen mit der H200 SXM: Das 1,9-Fache bei Llama 2 70B vergleicht laut NVIDIAs Fußnote eine H100 SXM bei Batchgröße 8 mit einer H200 SXM bei Batchgröße 32. Für absolute Zahlen zu Systemen mit acht NVL-Karten sind die Ergebnisse von MLPerf Inference und Training die wichtigste Quelle, die wir gefunden haben.

Grenzen, die das Datenblatt nicht zeigt

Strom und Luft. Die Karte zieht bis zu 600 W, konfigurierbar bis hinunter auf 200 W, über ein 16-poliges Kabel, dessen Sense-Pins die Klasse 451 bis 600 W melden müssen, sonst startet die Karte nicht. Sie ist passiv gekühlt und auf die Lüfter des Servers angewiesen, und NVIDIAs Product Brief nennt für sie keine Luftmenge, nur die Richtung des Luftstroms. Jede Systembeschreibung in den MLPerf-Ergebnissen oben, die eine Leistungsaufnahme angibt, nennt 600 W; keine zeigt die Karte in einem Server, dessen Hersteller sie niedriger begrenzt. Acht Karten ziehen bis zu 4,8 kW, bevor Prozessoren und Lüfter hinzukommen. Unsere Checkliste für vorhandene Server behandelt Kabel, Lüfter, Luftkanäle und Leistungsgrenzen je Gehäuse.

NVLink-Domänen. Eine Brücke verbindet zwei oder vier benachbarte Karten mit 900 GB/s je GPU, gegenüber 128 GB/s über PCIe Gen5. Ein Server mit acht Karten hat daher nach unserer Lesart höchstens zwei NVLink-Domänen zu je vier Karten, mit PCIe dazwischen, und Tensor-Parallelismus über mehr als vier Karten läuft über PCIe, wie unser Multi-GPU-Leitfaden durchrechnet.

Kein FP4. Hopper rechnet in FP8, und 4-Bit-Gewichte laufen als INT4 über AWQ oder GPTQ; TensorRT-LLM unterstützt NVFP4 nur auf Blackwell. Für ein nativ in FP4 veröffentlichtes Modell gibt es hier keinen nativen Pfad, und wir haben kein Ergebnis aus MLPerf Inference für die H200 NVL mit Llama 3.1 405B, DeepSeek-R1 oder gpt-oss-120b gefunden. Kartenzahlen für solche Modelle nennt unser Leitfaden zu großen Modellen.

Aufteilung und Software. MIG teilt die Karte in bis zu sieben Instanzen 1g.18gb mit je 16,5 GB; NCCL wird mit MIG nicht unterstützt, jede Instanz führt also Jobs für eine einzelne GPU aus. Für virtuelle GPUs führt NVIDIA für diese Karte nur Compute-vGPU-Typen (C-Serie), mit Time-Slicing oder auf MIG-Basis, ab vGPU 18.1 und lizenziert über NVIDIA AI Enterprise. NVIDIAs Product Brief verlangt Treiber R565 TRD1 oder neuer und nennt dazu CUDA 12.7, die CUDA-Version dieses Treibers (ein Toolkit 12.7 gibt es nicht; Toolkits ab 11.8 unterstützen Hopper). Für Video führt NVIDIA nur Decoder: 7 NVDEC und 7 JPEG.

Damit ist sie die falsche Karte für virtuelle Workstations und Grafik, für Modelle, die nativ in FP4 vorliegen, und für Server, die einen Steckplatz nicht mit 600 W und dem nötigen Luftstrom versorgen können. Die richtige ist sie für interaktives Serving von Modellen der 70B-Klasse, für Modelle, die zwei oder vier verbrückte Karten brauchen, und für doppelte Genauigkeit, mit 30 TFLOPS in FP64 und 60 auf ihren Tensor-Kernen, weshalb unser Leitfaden zum Ersatz der A100 solche Simulationsarbeit an sie verweist.

Was wir liefern

Eurokommerz liefert die NVIDIA H200 NVL EU-weit mit Herstellergarantie, unter einem EU-Vertrag und auf einer Rechnung, zusammen mit ihren Zweifach- und Vierfach-NVLink-Brücken; jede Karte kommt mit ihrem fünfjährigen Abonnement von NVIDIA AI Enterprise. Wir bauen KI-Server nach Auftrag, darunter einen Trainingsknoten mit acht H200 NVL und NVLink-Brücken, und prüfen Strom und Luftstrom im Rack, bevor wir ein Angebot machen. Unser Engineering-Partner Vixen.UNO liefert darauf aufbauend KI/ML-Integration: ein technisches Assessment mit Modell- und GPU-Auswahl und einem Pilotplan mit Metriken, danach private LLMs auf vLLM oder NVIDIA AI Enterprise in Ihrer Infrastruktur, unter dem Vertrag mit Eurokommerz.

FAQ

Wie schnell ist die H200 NVL mit Llama 2 70B in MLPerf Inference?
In MLPerf Inference v6.0, Closed Division, erreichte Dells PowerEdge XE7740 mit acht H200 NVL (Ergebnis 6.0-0021) mit Llama 2 70B und FP8-Gewichten offline 32.004 Token pro Sekunde, im Server-Szenario 29.084,9 und im Interactive-Szenario 16.343,8. Das sind je Karte etwa 4.000, 3.640 und 2.040 Token pro Sekunde, das Systemergebnis von uns geteilt, keine MLPerf-Metrik.
Wie viele Token pro Sekunde bekommt ein Nutzer auf einer H200 NVL?
Bei einem dichten 70B-Modell in FP8 begrenzt die Speicherbandbreite eine einzelne Anfrage auf einer Karte auf etwa 68 Token pro Sekunde: 4,8 TB/s geteilt durch etwa 70 GB Gewichte, die je Token gelesen werden, eine Obergrenze und keine Messung. Im Interactive-Szenario von MLPerf Inference v6.0, Closed Division, mit Llama 2 70B (Ergebnis 6.0-0021) bekam jede Anfrage etwa 28 Token pro Sekunde, während im Mittel etwa 72 Anfragen je Karte gleichzeitig in Bearbeitung waren, nach unserer Rechnung aus den Logs der Läufe, keine MLPerf-Metriken.
Ist die H200 NVL schneller als die RTX PRO 6000 Server Edition?
In MLPerf Inference v6.0, Closed Division, mit je acht Karten im selben Dell-Servermodell (Ergebnisse 6.0-0021 und 6.0-0022) lag die H200 NVL mit Llama 2 70B offline 18 Prozent und im Server-Szenario 14 Prozent vorn, mit FP8-Gewichten gegenüber dem FP4 der RTX PRO 6000. Unter den Interactive-Latenzgrenzen lieferte sie nach unserer Rechnung je Karte etwa das 2,6-Fache des Durchsatzes, verglichen mit Ergebnis 6.0-0004, dem System eines anderen Herstellers mit acht RTX PRO 6000 und FP4-Gewichten.
Unterstützt die H200 NVL FP4?
Nicht nativ. Hopper rechnet in FP8, aber nicht in FP4, TensorRT-LLM unterstützt NVFP4 nur auf Blackwell, und auf der H200 NVL laufen 4-Bit-Gewichte als INT4 über AWQ oder GPTQ mit 16-Bit- oder FP8-Aktivierungen.
Gibt es Ergebnisse aus MLPerf Training für die H200 NVL?
Ja. In MLPerf Training v6.0, Closed Division, führte Dells PowerEdge XE7740 mit acht H200 NVL (Ergebnis 6.0-0046) das Fine-Tuning von Llama 2 70B mit LoRA in 31,25 Minuten bis zum Zielwert des Benchmarks durch und trainierte Llama 3.1 8B in 257,4 Minuten bis zu dessen Zielwert vor; Dells XE7745 mit demselben Kartenmodell (Ergebnis 6.0-0047) brauchte 42,11 und 292,8 Minuten.
Wie viel Leistung braucht eine H200 NVL?
Bis zu 600 W je Karte, konfigurierbar bis hinunter auf 200 W, über ein 16-poliges Kabel, das die Klasse 451 bis 600 W melden muss, sonst startet die Karte nicht. Die Systeme in MLPerf Inference und Training, die eine Leistungsaufnahme angeben, betrieben die Karte mit 600 W, und acht Karten ziehen bis zu 4,8 kW, bevor Prozessoren und Lüfter hinzukommen.

Nennen Sie uns das Modell, seine Präzision, die Kontextlänge und wie viele Personen es gleichzeitig nutzen, und in welchen Server die Karten kommen sollen. Wir sagen Ihnen, was die veröffentlichten Ergebnisse für diese Last bedeuten und wie viele H200-NVL-Karten und Brücken sie braucht oder ob ein Build mit RTX PRO 6000 besser passt. Wir antworten innerhalb eines Werktages.

Mit einem Experten sprechen
Mit einem Experten sprechen

Wir antworten innerhalb eines Werktages

Mit dem Absenden stimmen Sie zu, dass wir Ihre Angaben zur Beantwortung Ihrer Anfrage verarbeiten – siehe unsere Datenschutzerklärung.

request@eurokommerz.at  ·  +43 1 585 1405 50  ·  Jordangasse 7, 1010 Wien